中文

R-Drop:面向神经网络的规范化 Dropout

机器学习 2021-11-01 v2

摘要

Dropout 是一种强大且被广泛使用的技术,用于正则化深度神经网络的训练。在本文中,我们提出一种在模型训练中对 dropout 应用的简单正则化策略,即 R-Drop,其强制由 dropout 生成的不同子模型的输出分布彼此一致。具体而言,对于每个训练样本,R-Drop 最小化由 dropout 采样得到的两个子模型输出分布之间的双向 KL 散度。理论分析表明,R-Drop 降低了模型参数的自由度并补充了 dropout。在 5\bf{5} 个广泛使用的深度学习任务(共计 18\bf{18} 个数据集)上的实验,包括神经机器翻译、抽象摘要、语言理解、语言建模和图像分类,表明 R-Drop 具有普遍有效性。特别地,当应用于微调大规模预训练模型(如 ViT、RoBERTa-large 和 BART)时,它带来了显著提升,并在 WMT14 英\to德翻译(30.91\bf{30.91} BLEU)和 WMT14 英\to法翻译(43.95\bf{43.95} BLEU)上以原生 Transformer 模型取得了最先进(SOTA)性能,甚至超越了使用超大规模数据与专家设计的 Transformer 模型高级变体训练的模型。我们的代码可在 GitHub{\url{https://github.com/dropreg/R-Drop}} 获取。

关键词

引用

@article{arxiv.2106.14448,
  title  = {R-Drop: Regularized Dropout for Neural Networks},
  author = {Xiaobo Liang and Lijun Wu and Juntao Li and Yue Wang and Qi Meng and Tao Qin and Wei Chen and Min Zhang and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2106.14448},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021