中文

利用词对齐注意力增强中文预训练字表示

计算与语言 2020-04-30 v2

摘要

多数中文预训练模型以字为基本单元,并依据字的外部上下文学习表示,忽略了词中所表达的语义,而词是中文中最小的有意义语言单位。因此,我们提出一种新颖的词对齐注意力来利用显式词信息,其作为各类基于字的中文预训练语言模型的补充。具体而言,我们设计了一种池化机制将字级注意力对齐到词级,并提出通过多源信息融合来缓解分词错误传播的潜在问题。由此,词与字信息在微调过程中被显式整合。在五个中文 NLP 基准任务上的实验结果表明,我们的模型能在若干预训练模型之上带来进一步的显著增益。

关键词

引用

@article{arxiv.1911.02821,
  title  = {Enhancing Pre-trained Chinese Character Representation with Word-aligned Attention},
  author = {Yanzeng Li and Bowen Yu and Mengge Xue and Tingwen Liu},
  journal= {arXiv preprint arXiv:1911.02821},
  year   = {2020}
}

备注

Accepted to appear at ACL 2020