重访中文自然语言处理的预训练模型
计算与语言
2020-12-14 v2
摘要
基于Transformer的双向编码器表示(BERT)在各种NLP任务中展现出了惊人的改进,并且已经提出了连续的变体以进一步提升预训练语言模型的性能。在本文中,我们旨在重访中文预训练语言模型,以检验它们在非英语语言中的有效性,并向社区发布中文预训练语言模型系列。我们还提出了一个简单但有效的模型,称为MacBERT,它在若干方面改进了RoBERTa,特别是采用了以MLM作为纠错(Mac)的掩码策略。我们在八个中文NLP任务上进行了广泛的实验,以重访现有的预训练语言模型以及所提出的MacBERT。实验结果表明,MacBERT在许多NLP任务上都能取得最先进的性能,我们还通过若干发现对细节进行了消融研究,这些发现可能有助于未来的研究。可用资源:https://github.com/ymcui/MacBERT
引用
@article{arxiv.2004.13922,
title = {Revisiting Pre-Trained Models for Chinese Natural Language Processing},
author = {Yiming Cui and Wanxiang Che and Ting Liu and Bing Qin and Shijin Wang and Guoping Hu},
journal= {arXiv preprint arXiv:2004.13922},
year = {2020}
}
备注
12 pages, to appear at Findings of EMNLP 2020