中文

通过分量式梯度范数裁剪提升预训练语言模型微调的稳定性

计算与语言 2022-10-20 v1

摘要

在大型预训练语言模型(PLMs)上的微调已确立许多最先进的结果。尽管性能优越,此类微调可能不稳定,导致性能的显著方差及实际应用中的潜在风险。先前工作将这种不稳定性归因于 PLMs 顶层中的灾难性遗忘问题,并迭代地指出以自顶向下方式微调层是一种有前景的解决方案。本文中,我们首先指出该方法并非总是有效,原因在于不同层/模块的收敛速度不同。受此观察启发,我们提出一种简单的分量式梯度范数裁剪方法,以调整不同组件的收敛速度。实验结果表明,我们的方法在泛化性能、收敛速度与训练稳定性方面均取得一致提升。代码库见 https://github.com/yangalan123/FineTuningStability。

关键词

引用

@article{arxiv.2210.10325,
  title  = {Improving Stability of Fine-Tuning Pretrained Language Models via Component-Wise Gradient Norm Clipping},
  author = {Chenghao Yang and Xuezhe Ma},
  journal= {arXiv preprint arXiv:2210.10325},
  year   = {2022}
}

备注

EMNLP 2022 Camera Ready