中文

通过随机权重平均提升预训练语言模型的泛化能力

计算与语言 2022-12-20 v2 机器学习

摘要

知识蒸馏(KD)是一种常用的技术,用于提升紧凑型预训练语言模型(PLMs)在下游任务上的泛化能力。然而,这类方法为每一个新数据集训练单独的教师模型带来了额外负担。或者,可以直接改进紧凑模型的优化过程以获得更好的泛化。近期工作观察到,局部极小值的平坦度与更好的泛化密切相关。在本工作中,我们将鼓励收敛到更平坦最小值的随机权重平均(SWA)方法适配到PLMs的微调中。我们在多种NLP任务(文本分类、问答和生成)以及不同模型架构上进行了大量实验,表明我们的适配在不增加额外计算成本的情况下改善了泛化。此外,我们观察到这一简单的优化技术能够超越紧凑模型上最先进的KD方法。

关键词

引用

@article{arxiv.2212.05956,
  title  = {Improving Generalization of Pre-trained Language Models via Stochastic Weight Averaging},
  author = {Peng Lu and Ivan Kobyzev and Mehdi Rezagholizadeh and Ahmad Rashid and Ali Ghodsi and Philippe Langlais},
  journal= {arXiv preprint arXiv:2212.05956},
  year   = {2022}
}

备注

Published at EMNLP 2022 (Findings)