中文

利用 Fisher 掩码改进 Sharpness-Aware Minimization 以提升语言模型的泛化能力

计算与语言 2022-10-12 v1

摘要

在有限的训练语料上微调大型预训练语言模型通常存在泛化能力差的问题。先前的工作表明,最近提出的 Sharpness-Aware Minimization (SAM) 优化方法可以提高模型的泛化能力。然而,SAM 对每个模型参数同等地添加扰动(但并非所有参数对训练优化的贡献都相同),我们认为这是次优的,并会导致过度的计算。在本文中,我们提出了一种新颖的优化过程,即 FSAM,它引入了 Fisher 掩码来提高 SAM 的效率和性能。简而言之,FSAM 不再对所有参数添加扰动,而是使用 Fisher 信息来识别重要参数,并构建 Fisher 掩码以获得稀疏扰动,即让优化器专注于这些重要参数。在 GLUE 和 SuperGLUE 基准上的各种任务实验表明,在四种不同的预训练模型中,FSAM 的平均得分始终比原始 SAM 高出 0.67~1.98。我们还通过实验证明,FSAM 在其他复杂场景中同样表现良好,例如在生成任务或有限训练数据上进行微调。令人鼓舞的是,当训练数据有限时,FSAM 大幅提升了 SAM 的性能,即提升高达 15.1。

关键词

引用

@article{arxiv.2210.05497,
  title  = {Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language Models},
  author = {Qihuang Zhong and Liang Ding and Li Shen and Peng Mi and Juhua Liu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2210.05497},
  year   = {2022}
}

备注

Accepted by EMNLP 2022 (Findings)