中文

基于加速异构知识预训练重审与推进中文自然语言理解

计算与语言 2022-10-13 v2

摘要

近期,知识增强预训练语言模型(KEPLMs)通过学习知识图谱中的结构化关系和/或来自句法或依存分析的语言知识,改进了上下文感知表示。与英文不同,自然语言处理(NLP)社区缺乏高性能的开源中文 KEPLMs 来支持各种语言理解应用。在本文中,我们重审并推进了中文自然语言理解的发展,发布了具有不同参数规模的一系列新型中文 KEPLMs,即 CKBERT(中文知识增强 BERT)。具体而言,基于两个新颖的预训练任务,即语言感知掩码语言建模与对比多跳关系建模,关系知识与语言知识被有效注入 CKBERT。基于上述两种预训练范式与我们内部实现的 TorchAccelerator,我们在 GPU 集群上高效预训练了基础版(110M)、大版(345M)和超大版(1.3B)的 CKBERT。实验表明,在各种基准 NLP 任务上以及在不同模型规模下,CKBERT 在中文处理上均优于强基线模型。

关键词

引用

@article{arxiv.2210.05287,
  title  = {Revisiting and Advancing Chinese Natural Language Understanding with Accelerated Heterogeneous Knowledge Pre-training},
  author = {Taolin Zhang and Junwei Dong and Jianing Wang and Chengyu Wang and Ang Wang and Yinghui Liu and Jun Huang and Yong Li and Xiaofeng He},
  journal= {arXiv preprint arXiv:2210.05287},
  year   = {2022}
}

备注

EMNLP 2022 industry track