中文

关于微调 BERT 的稳定性:误解、解释与强基线

机器学习 2021-03-26 v3 机器学习

摘要

微调基于预训练 transformer 的语言模型(如 BERT)已成为一种常见做法,在各类 NLP 基准的排行榜上占据主导。尽管微调模型具有强劲的实证性能,但微调是一个不稳定的过程:使用多个随机种子训练同一模型可能导致任务性能出现较大方差。先前文献(Devlin 等,2019;Lee 等,2020;Dodge 等,2020)指出了观察到的不稳定性的两个潜在原因:灾难性遗忘和微调数据集规模较小。在本文中,我们表明这两种假设均无法解释微调不稳定性。我们分析了在 GLUE 基准常用数据集上微调的 BERT、RoBERTa 和 ALBERT,并表明观察到的不稳定性是由导致梯度消失的优化困难引起的。此外,我们表明下游任务性能的剩余方差可归因于泛化差异,即具有相同训练损失的微调模型表现出明显不同的测试性能。基于我们的分析,我们提出了一个简单但强力的基线,使基于 BERT 的模型的微调比先前提出的方法显著更稳定。复现我们结果的代码可在线获取:https://github.com/uds-lsv/bert-stable-fine-tuning。

关键词

引用

@article{arxiv.2006.04884,
  title  = {On the Stability of Fine-tuning BERT: Misconceptions, Explanations, and Strong Baselines},
  author = {Marius Mosbach and Maksym Andriushchenko and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2006.04884},
  year   = {2021}
}

备注

ICLR 2021