DeBERTaV3:利用 ELECTRA 风格预训练与梯度解耦嵌入共享改进 DeBERTa
摘要
本文提出一种新的预训练语言模型 DeBERTaV3,它通过以样本效率更高的预训练任务——替换 token 检测(RTD)替代掩码语言建模(MLM)来改进原始 DeBERTa 模型。我们的分析表明,ELECTRA 中朴素的嵌入共享会损害训练效率与模型性能,这是因为判别器与生成器的训练损失将 token 嵌入拉向不同方向,产生“拔河”动态。为此,我们提出一种新的梯度解耦嵌入共享方法,避免了拔河动态,提升了训练效率与预训练模型质量。我们使用与 DeBERTa 相同的设置预训练了 DeBERTaV3,以展示其在广泛下游自然语言理解(NLU)任务上的卓越性能。以包含八项任务的 GLUE 基准为例,DeBERTaV3 Large 模型取得 91.37% 的平均分,较 DeBERTa 高 1.37%、较 ELECTRA 高 1.91%,在同类结构模型中创下新的 state-of-the-art(SOTA)。此外,我们预训练了多语言模型 mDeBERTa,观察到相比英语模型在强基线上有更大提升;例如 mDeBERTa Base 在 XNLI 上取得 79.8% 的零样本跨语言准确率,较 XLM-R Base 提升 3.6%,在该基准上创下新的 SOTA。我们已在 https://github.com/microsoft/DeBERTa 公开预训练模型与推理代码。
引用
@article{arxiv.2111.09543,
title = {DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing},
author = {Pengcheng He and Jianfeng Gao and Weizhu Chen},
journal= {arXiv preprint arXiv:2111.09543},
year = {2023}
}
备注
16 pages, 10 tables, 2 Figures. The DeBERTaV3 model significantly improves performance of the downstream NLU tasks over models with a similar structure, e.g. DeBERTaV3 large achieves 91.37% average GLUE score which is 1.37% over DeBERTa large. XSmall has only 22M backbone parameters, but significantly outperforms RoBERTa/XLNet-base. Paper is published as a conference paper at ICLR 2023