中文

ERNIE-Gram:面向自然语言理解的显式 N 元语法掩码语言模型预训练

计算与语言 2021-04-14 v2 机器学习

摘要

粗粒度语言信息(如命名实体或短语)有助于在预训练中充分学习表示。以往工作主要集中于将 BERT 的掩码语言建模(MLM)目标从掩码单个词元扩展至连续的 n 个词元序列。我们认为这种连续掩码方法忽略了对粗粒度语言信息的内部依赖与相互关系的建模。作为替代,我们提出 ERNIE-Gram,一种显式 n 元语法掩码方法,以增强粗粒度信息融入预训练。在 ERNIE-Gram 中,n 元语法被直接使用显式 n 元语法标识进行掩码和预测,而非连续的 n 个词元序列。此外,ERNIE-Gram 采用生成器模型采样合理的 n 元语法标识作为可选 n 元语法掩码,并以粗粒度和细粒度两种方式预测它们,以实现全面的 n 元语法预测与关系建模。我们在英文和中文文本语料库上预训练 ERNIE-Gram,并在 19 个下游任务上微调。实验结果表明,ERNIE-Gram 大幅优于 XLNet 和 RoBERTa 等先前预训练模型,并取得了与最先进方法相当的结果。源代码与预训练模型已发布于 https://github.com/PaddlePaddle/ERNIE。

关键词

引用

@article{arxiv.2010.12148,
  title  = {ERNIE-Gram: Pre-Training with Explicitly N-Gram Masked Language Modeling for Natural Language Understanding},
  author = {Dongling Xiao and Yu-Kun Li and Han Zhang and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2010.12148},
  year   = {2021}
}

备注

Accepted by NAACL-HLT 2021. Codes will be released at https://github.com/PaddlePaddle/ERNIE