中文

本征维度解释了语言模型微调的有效性

机器学习 2020-12-25 v1 计算与语言

摘要

尽管预训练语言模型可被微调以在非常广泛的语言理解任务上产生最先进(SOTA)结果,但该过程的动力学尚未被很好理解,尤其在低数据情形下。为何我们能使用相对朴素的梯度下降算法(例如,无强正则化)在仅含数百或数千标注样本的数据集上调整具有数亿参数的模型?在本文中,我们主张通过本征维度的视角分析微调,可为我们提供经验与理论直觉以解释这一显著现象。我们经验性地表明,常见的预训练模型具有极低的本征维度;换言之,存在一种低维重参数化,其对于微调的有效性等同于完整参数空间。例如,通过仅优化随机投影回完整空间的 200 个可训练参数,我们可将 RoBERTa 模型微调至在 MRPC 上达到完整参数性能水平的 90%。此外,我们经验性地表明预训练隐式地最小化本征维度,并且或许令人惊讶的是,更大的模型在固定次数的预训练更新后往往具有更低的本征维度,这至少部分解释了它们的极致有效性。最后,我们将本征维度与低维任务表示及基于压缩的泛化界相联系,以提供独立于完整参数数量的基于本征维度的泛化界。

关键词

引用

@article{arxiv.2012.13255,
  title  = {Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning},
  author = {Armen Aghajanyan and Luke Zettlemoyer and Sonal Gupta},
  journal= {arXiv preprint arXiv:2012.13255},
  year   = {2020}
}