中文

SpellGCN:将语音与视觉相似性融入语言模型用于中文拼写检查

计算与语言 2020-05-14 v2

摘要

中文拼写检查(CSC)是一项检测并纠正中文自然语言中的拼写错误的任务。现有方法已尝试融入汉字间的相似性知识。然而,它们或将相似性知识作为外部输入资源,或仅作为启发式规则。本文提出通过专门的图卷积网络(SpellGCN)将语音和视觉相似性知识融入语言模型用于 CSC。该模型在字符上构建图,并学习将图映射为一组相互依赖的字符分类器。这些分类器应用于另一网络(如 BERT)提取的表示,使整个网络可端到端训练。实验(本文数据集与所有代码见 https://github.com/ACL2020SpellGCN/SpellGCN)在三个人工标注数据集上进行。我们的方法以较大优势取得优于以往模型的性能。

关键词

引用

@article{arxiv.2004.14166,
  title  = {SpellGCN: Incorporating Phonological and Visual Similarities into Language Models for Chinese Spelling Check},
  author = {Xingyi Cheng and Weidi Xu and Kunlong Chen and Shaohua Jiang and Feng Wang and Taifeng Wang and Wei Chu and Yuan Qi},
  journal= {arXiv preprint arXiv:2004.14166},
  year   = {2020}
}

备注

Accepted by ACL2020