中文

MVP-BERT:面向中文BERT的词表重设计与多词表预训练

计算与语言 2020-11-18 v1

摘要

尽管预训练语言模型(PLM)的发展显著提升了各类中文自然语言处理(NLP)任务的性能,这些中文PLM的词表仍是Google中文Bert所提供的基于汉字的那一个。其次,掩码语言模型预训练基于单一词表,这限制了其下游任务性能。在本工作中,我们首先提出一种新方法\emph{seg\_tok},借助中文分词(CWS)与子词切分来构建中文BERT的词表。然后我们提出三个版本的多词表预训练(MVP)以提升模型的表达能力。实验表明:(a) 与基于字的词表相比,\emph{seg\_tok}不仅提升了中文PLM在句子级任务上的性能,还能提高效率;(b) MVP提升了PLM的下游性能,尤其能提升\emph{seg\_tok}在序列标注任务上的性能。

关键词

引用

@article{arxiv.2011.08539,
  title  = {MVP-BERT: Redesigning Vocabularies for Chinese BERT and Multi-Vocab Pretraining},
  author = {Wei Zhu},
  journal= {arXiv preprint arXiv:2011.08539},
  year   = {2020}
}