中文

ChineseBERT:融合字形与拼音信息的中文预训练模型

计算与语言 2021-07-01 v1

摘要

近期的中文预训练模型忽视了中文语言特有的两个方面:字形与拼音,它们承载着语言理解的重要句法与语义信息。本文提出 ChineseBERT,将汉字的字形与拼音信息均融入语言模型预训练。字形嵌入基于汉字的不同字体获得,能够从视觉特征中捕捉字符语义;拼音嵌入刻画汉字发音,可处理中文中高度普遍的异字多音现象(同一汉字具有不同读音与不同含义)。在大规模无标注中文语料上预训练后,所提出的 ChineseBERT 模型以更少的训练步数相较基线模型取得显著性能提升。该模型在广泛的中文 NLP 任务上达到新的 SOTA 性能,包括机器阅读理解、自然语言推理、文本分类、句子对匹配,并在命名实体识别中取得有竞争力的性能。代码与预训练模型已公开于 https://github.com/ShannonAI/ChineseBert。

关键词

引用

@article{arxiv.2106.16038,
  title  = {ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin Information},
  author = {Zijun Sun and Xiaoya Li and Xiaofei Sun and Yuxian Meng and Xiang Ao and Qing He and Fei Wu and Jiwei Li},
  journal= {arXiv preprint arXiv:2106.16038},
  year   = {2021}
}

备注

To appear at ACL2021