用于 Transformer 掩码微调的梯度稀疏化
计算与语言
2023-07-20 v1 机器学习
摘要
微调预训练自监督语言模型被广泛用于向下游任务的迁移学习。微调可通过冻结预训练网络的梯度而仅更新新添加分类层的梯度实现,或通过对所有参数执行梯度更新实现。渐进式解冻通过在训练期间逐步解冻整个层的梯度,在二者之间做出权衡。这一策略在存储与训练速度同泛化性能之间取得了有效折中。然而,与可能改善微调性能的渐进式解冻的稀疏变体相比,在整个训练过程中逐步解冻各层是否为最优尚不清楚。本文中,我们提出随机掩码梯度以正则化预训练语言模型,从而提升整体微调性能。我们引入 GradDrop 及其变体,一类在反向传播期间掩码梯度、充当梯度噪声的梯度稀疏化方法。不同于渐进式冻结,GradDrop 是稀疏且随机的。在多语言 XGLUE 基准上使用 XLMR-Large 的大量实验表明,GradDrop 相较于使用额外翻译数据做中间预训练的方法具有竞争力,且优于标准微调与渐进式解冻。事后分析显示了 GradDrop 如何在其未训练过的语言(如资源匮乏语言)上提升性能。
引用
@article{arxiv.2307.10098,
title = {Gradient Sparsification For Masked Fine-Tuning of Transformers},
author = {James O' Neill and Sourav Dutta},
journal= {arXiv preprint arXiv:2307.10098},
year = {2023}
}
备注
Accepted to IJCNN 2023