通过缓解表示崩塌改进微调
机器学习
2020-08-10 v1 计算与语言
机器学习
摘要
尽管已被广泛采用,现有的预训练语言模型微调方法被证明在不同超参数设置下不稳定,这促使了近期关于信赖域方法的研究。在本文中,我们提出一种植根于信赖域理论的简化高效方法,用参数化噪声(从正态分布或均匀分布中采样)替代先前使用的对抗目标,从而在不损害性能的前提下尽可能阻止微调过程中的表示变化。我们还引入一种新的分析,通过研究表示崩塌——即预训练模型的可泛化表示在为其特定末端任务微调时发生退化——来更一般地论证信赖域方法的使用。大量实验表明,我们的微调方法在一系列理解与生成任务(包括 DailyMail/CNN、Gigaword、Reddit TIFU 和 GLUE 基准)上匹配或超越了先前信赖域方法的性能,同时速度也快得多。我们还表明它更不易发生表示崩塌;预训练模型在每次微调时都保持更多的可泛化表示。
引用
@article{arxiv.2008.03156,
title = {Better Fine-Tuning by Reducing Representational Collapse},
author = {Armen Aghajanyan and Akshat Shrivastava and Anchit Gupta and Naman Goyal and Luke Zettlemoyer and Sonal Gupta},
journal= {arXiv preprint arXiv:2008.03156},
year = {2020}
}