SpellGCN:将语音与视觉相似性融入语言模型用于中文拼写检查
计算与语言
2020-05-14 v2
摘要
中文拼写检查(CSC)是一项检测并纠正中文自然语言中的拼写错误的任务。现有方法已尝试融入汉字间的相似性知识。然而,它们或将相似性知识作为外部输入资源,或仅作为启发式规则。本文提出通过专门的图卷积网络(SpellGCN)将语音和视觉相似性知识融入语言模型用于 CSC。该模型在字符上构建图,并学习将图映射为一组相互依赖的字符分类器。这些分类器应用于另一网络(如 BERT)提取的表示,使整个网络可端到端训练。实验(本文数据集与所有代码见 https://github.com/ACL2020SpellGCN/SpellGCN)在三个人工标注数据集上进行。我们的方法以较大优势取得优于以往模型的性能。
引用
@article{arxiv.2004.14166,
title = {SpellGCN: Incorporating Phonological and Visual Similarities into Language Models for Chinese Spelling Check},
author = {Xingyi Cheng and Weidi Xu and Kunlong Chen and Shaohua Jiang and Feng Wang and Taifeng Wang and Wei Chu and Yuan Qi},
journal= {arXiv preprint arXiv:2004.14166},
year = {2020}
}
备注
Accepted by ACL2020