LoRA(Low-Rank Adaptation)为什么能大幅降低微调大模型的显存与存储成本?

大模型应用基础

  1. A.它把模型层数砍掉一半,只训练剩下的层并丢弃其余参数
  2. B.它冻结原权重 W,只训练低秩增量 ΔW = A·B,可训练参数减少几个数量级
  3. C.它把所有权重量化到 1 bit 后再训练
  4. D.它只在推理阶段起作用,训练阶段的梯度显存与优化器状态开销与全参数微调处于同一量级