中文

基于全词掩码预训练的中文BERT

计算与语言 2021-11-29 v3 机器学习

摘要

基于Transformer的双向编码器表示(BERT)在各种NLP任务中展现出惊人的改进,其连续变体已被提出以进一步提升预训练语言模型的性能。在本文中,我们旨在首先为中文BERT引入全词掩码(wwm)策略,以及一系列中文预训练语言模型。然后我们还提出了一种简单而有效的模型称为MacBERT,它在若干方面改进了RoBERTa。特别地,我们提出了一种称为MLM as correction(Mac)的新掩码策略。为证明这些模型的有效性,我们创建了一系列中文预训练语言模型作为基线,包括BERT、RoBERTa、ELECTRA、RBT等。我们在十个中文NLP任务上进行了广泛实验,以评估所创建的中文预训练语言模型及提出的MacBERT。实验结果表明,MacBERT在许多NLP任务上可达到最先进性能,我们还通过若干发现进行了细节消融,可能有助于未来研究。我们开源了我们的预训练语言模型以进一步促进研究社区。资源可用:https://github.com/ymcui/Chinese-BERT-wwm

关键词

引用

@article{arxiv.1906.08101,
  title  = {Pre-Training with Whole Word Masking for Chinese BERT},
  author = {Yiming Cui and Wanxiang Che and Ting Liu and Bing Qin and Ziqing Yang},
  journal= {arXiv preprint arXiv:1906.08101},
  year   = {2021}
}

备注

11 pages. Journal extension to arXiv:2004.13922