中文

从NTK视角理解线性探测后微调语言模型

机器学习 2024-10-23 v2

摘要

两阶段微调(FT)方法,即线性探测(LP)后微调(LP-FT),优于单独使用线性探测和微调。这对于分布内(ID)和分布外(OOD)数据都成立。其成功的一个关键原因是在LP期间获得接近最优的线性头,从而保留了预训练特征。然而,尽管大语言模型广泛使用,但对更复杂架构(如Transformer)的探索仍然有限。在本文中,我们基于神经正切核(NTK)理论分析了分类任务中LP-FT的训练动力学。我们的分析将NTK矩阵分解为两个分量。这种分解突出了在FT阶段开始时线性头范数以及预测准确性的重要性。我们还观察到在LP期间线性头范数显著增加,这源于使用交叉熵(CE)损失进行训练。这种线性头范数的增加有效地减少了学习特征的变化。此外,我们发现这种增加的范数可能对模型校准产生不利影响,可以通过温度缩放进行校正。此外,我们将NTK分析扩展到低秩适应(LoRA)方法,并验证了其有效性。我们在多个自然语言处理数据集上使用基于Transformer的模型进行的实验证实了我们的理论分析。我们的研究证明了LP-FT在微调语言模型中的有效性。代码可在https://github.com/tom4649/lp-ft_ntk获取。

关键词

引用

@article{arxiv.2405.16747,
  title  = {Understanding Linear Probing then Fine-tuning Language Models from NTK Perspective},
  author = {Akiyoshi Tomihari and Issei Sato},
  journal= {arXiv preprint arXiv:2405.16747},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024