1 全参数微调(Full-FT)
顾名思义,全参微调(Full-Fine-tuning)类似于预训练阶段,使用目标领域的少量语料对整个模型进行微调。这种方法虽然实现简单,但灵活性较低,且对计算资源的需求较高。
2 BitFit
BitFit 是一种稀疏参数微调方法,其核心思想是冻结大部分 Transformer-encoder 的参数,仅更新模型中的 bias 参数 和特定任务相关的分类层参数。尽管 bias 参数在模型总参数中占比较小(通常不到 0.1%),但其微调效果却非常显著。下图展示了 BitFit 与其他微调方法的对比实验结果:

通过对 BitFit 训练前后参数的对比分析,研究人员发现,许多 bias 参数的变化并不明显(例如,与计算 key 相关的 bias 参数)。然而,计算 query 的 bias 参数 和 FFN 层(intermediate)中将特征维度从 N 扩展到 4N 的 bias 参数 变化最为显著。实验表明,仅更新这两类 bias 参数也能取得较好的效果;反之,如果固定其中任何一者,模型性能都会显著下降。下图展示了基于 BERT-base 的微调结果:
