R-Drop:面向神经网络的规范化 Dropout
机器学习
2021-11-01 v2
摘要
Dropout 是一种强大且被广泛使用的技术,用于正则化深度神经网络的训练。在本文中,我们提出一种在模型训练中对 dropout 应用的简单正则化策略,即 R-Drop,其强制由 dropout 生成的不同子模型的输出分布彼此一致。具体而言,对于每个训练样本,R-Drop 最小化由 dropout 采样得到的两个子模型输出分布之间的双向 KL 散度。理论分析表明,R-Drop 降低了模型参数的自由度并补充了 dropout。在 个广泛使用的深度学习任务(共计 个数据集)上的实验,包括神经机器翻译、抽象摘要、语言理解、语言建模和图像分类,表明 R-Drop 具有普遍有效性。特别地,当应用于微调大规模预训练模型(如 ViT、RoBERTa-large 和 BART)时,它带来了显著提升,并在 WMT14 英德翻译( BLEU)和 WMT14 英法翻译( BLEU)上以原生 Transformer 模型取得了最先进(SOTA)性能,甚至超越了使用超大规模数据与专家设计的 Transformer 模型高级变体训练的模型。我们的代码可在 GitHub{\url{https://github.com/dropreg/R-Drop}} 获取。
引用
@article{arxiv.2106.14448,
title = {R-Drop: Regularized Dropout for Neural Networks},
author = {Xiaobo Liang and Lijun Wu and Juntao Li and Yue Wang and Qi Meng and Tao Qin and Wei Chen and Min Zhang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2106.14448},
year = {2021}
}
备注
Accepted by NeurIPS 2021