中文

DeBERTa:具有解耦注意力机制的解码增强 BERT

计算与语言 2021-10-08 v6 机器学习

摘要

预训练神经语言模型的最新进展显著提升了许多自然语言处理(NLP)任务的性能。本文提出一种新的模型架构 DeBERTa(具有解耦注意力的解码增强 BERT),其利用两种新技术改进 BERT 和 RoBERTa 模型。其一是解耦注意力机制,其中每个词使用分别编码其内容与位置的两个向量表示,词之间的注意力权重分别基于其内容与相对位置通过解耦矩阵计算。其二是使用增强的掩码解码器,在解码层中引入绝对位置以预测模型预训练中的掩码词元。此外,采用一种新的虚拟对抗训练方法进行微调,以提升模型的泛化能力。我们表明,这些技术显著提高了模型预训练的效率以及自然语言理解(NLU)和自然语言生成(NLG)下游任务的性能。与 RoBERTa-Large 相比,在半数训练数据上训练的 DeBERTa 模型在广泛的 NLP 任务上持续表现更优,在 MNLI 上提升 +0.9%(90.2% 对比 91.1%),在 SQuAD v2.0 上提升 +2.3%(88.4% 对比 90.7%),在 RACE 上提升 +3.6%(83.2% 对比 86.8%)。值得注意的是,我们通过训练一个由 48 个 Transformer 层、15 亿参数组成的更大版本来扩展 DeBERTa。显著的性能提升使得单个 DeBERTa 模型首次在 SuperGLUE 基准(Wang et al., 2019a)上以宏平均分数(89.9 对比 89.8)超越人类表现,且截至 2021 年 1 月 6 日,集成 DeBERTa 模型位居 SuperGLUE 排行榜首位,以明显优势(90.3 对比 89.8)超越人类基线。

关键词

引用

@article{arxiv.2006.03654,
  title  = {DeBERTa: Decoding-enhanced BERT with Disentangled Attention},
  author = {Pengcheng He and Xiaodong Liu and Jianfeng Gao and Weizhu Chen},
  journal= {arXiv preprint arXiv:2006.03654},
  year   = {2021}
}

备注

20 pages,5 figures, 13 tables. In v2, we scale up DeBERTa to 1.5B parameters and it surpasses the human performance on SuperGLUE leaderboard for the first time as of December 29, 2020. In v3, we replace MLM with RTD objective which significantly improves the model performance