利用词语义丰富中文预训练模型的字表示
计算与语言
2022-07-14 v1
摘要
大多数中文预训练模型采用字作为下游任务的基本单元。然而,这些模型忽略了词所携带的信息,从而导致部分重要语义的丢失。本文提出一种新方法,利用词结构并将词汇语义整合进预训练模型的字表示中。具体而言,我们根据相似度权重将一个词的嵌入投影到其内部字的嵌入中。为加强词边界信息,我们混合词内各字表示。此后,我们应用词到字对齐注意力机制,通过掩蔽不重要的字来强调重要字。此外,为减少分词引起的错误传播,我们提出一种集成方法以结合不同分词器给出的分词结果。实验结果表明,在情感分类、句对匹配、自然语言推理与机器阅读理解等不同中文 NLP 任务上,我们的方法优于基础预训练模型 BERT、BERT-wwm 与 ERNIE。我们进一步分析以证明模型各组件的有效性。
引用
@article{arxiv.2207.05928,
title = {Exploiting Word Semantics to Enrich Character Representations of Chinese Pre-trained Models},
author = {Wenbiao Li and Rui Sun and Yunfang Wu},
journal= {arXiv preprint arXiv:2207.05928},
year = {2022}
}