语言模型微调的核视角
机器学习
2023-06-07 v4 计算与语言
摘要
通过微调预训练语言模型(LM)来解决 NLP 任务已成为标准做法,尤其在低数据场景下。目前对其经验成功缺乏理论理解,例如为何在仅数十个训练点上微调具有 或更多参数的模型不会导致过拟合。我们研究神经切线核(NTK)——其起源为研究具有合适随机初始化的无限宽网络梯度下降动力学的模型——是否刻画了预训练 LM 的微调。该项研究受 NTK 在计算机视觉任务中尚可表现(Wei et al., 2022)的启发。我们将 NTK 形式推广至 Adam,并利用 Tensor Programs(Yang, 2020)刻画 NTK 视角可描述预训练语言模型微调更新的条件。在 14 个 NLP 任务上的大量实验验证了我们的理论,并表明通过提示将下游任务表述为掩码词预测问题常会在微调期间引发基于核的动力学。最后,我们利用该核视角对参数高效的基于子空间的微调方法的成功提出一种解释。
引用
@article{arxiv.2210.05643,
title = {A Kernel-Based View of Language Model Fine-Tuning},
author = {Sadhika Malladi and Alexander Wettig and Dingli Yu and Danqi Chen and Sanjeev Arora},
journal= {arXiv preprint arXiv:2210.05643},
year = {2023}
}
备注
Accepted at ICML 2023. Code and pre-computed kernels are publicly available at https://github.com/princeton-nlp/LM-Kernel-FT