中文

UniDrop:一种简单而有效的无额外成本改进 Transformer 的技术

计算与语言 2021-04-13 v1

摘要

Transformer 架构在大量自然语言处理任务中取得了巨大成功。Transformer 模型的过参数化促使大量工作缓解其过拟合以获得更优性能。通过一些探索,我们发现 dropout 等简单技术经过精心设计可大幅提升模型性能。因此,本文将对不同的 dropout 技术集成到 Transformer 模型的训练中。具体而言,我们提出一种名为 UniDrop 的方法,从细粒度到粗粒度统一三种不同的 dropout 技术,即特征 dropout、结构 dropout 和数据 dropout。理论上,我们从正则化视角证明这三种 dropout 扮演不同角色。在实证上,我们在神经机器翻译和文本分类基准数据集上进行了实验。广泛的结果表明,采用 UniDrop 的 Transformer 在 IWSLT14 翻译任务上可获得约 1.5 BLEU 的提升,且即使使用强预训练 RoBERTa 作为骨干网络,分类准确率也更高。

关键词

引用

@article{arxiv.2104.04946,
  title  = {UniDrop: A Simple yet Effective Technique to Improve Transformer without Extra Cost},
  author = {Zhen Wu and Lijun Wu and Qi Meng and Yingce Xia and Shufang Xie and Tao Qin and Xinyu Dai and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2104.04946},
  year   = {2021}
}

备注

Accepted by NAACL 2021