UniDrop:一种简单而有效的无额外成本改进 Transformer 的技术
计算与语言
2021-04-13 v1
摘要
Transformer 架构在大量自然语言处理任务中取得了巨大成功。Transformer 模型的过参数化促使大量工作缓解其过拟合以获得更优性能。通过一些探索,我们发现 dropout 等简单技术经过精心设计可大幅提升模型性能。因此,本文将对不同的 dropout 技术集成到 Transformer 模型的训练中。具体而言,我们提出一种名为 UniDrop 的方法,从细粒度到粗粒度统一三种不同的 dropout 技术,即特征 dropout、结构 dropout 和数据 dropout。理论上,我们从正则化视角证明这三种 dropout 扮演不同角色。在实证上,我们在神经机器翻译和文本分类基准数据集上进行了实验。广泛的结果表明,采用 UniDrop 的 Transformer 在 IWSLT14 翻译任务上可获得约 1.5 BLEU 的提升,且即使使用强预训练 RoBERTa 作为骨干网络,分类准确率也更高。
引用
@article{arxiv.2104.04946,
title = {UniDrop: A Simple yet Effective Technique to Improve Transformer without Extra Cost},
author = {Zhen Wu and Lijun Wu and Qi Meng and Yingce Xia and Shufang Xie and Tao Qin and Xinyu Dai and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2104.04946},
year = {2021}
}
备注
Accepted by NAACL 2021