中文

KNPTC:基于知识与神经机器翻译的中文拼音错别字纠正方法

计算与语言 2018-05-03 v1 人工智能

摘要

中文拼音输入法对于中文语言处理非常重要。实际上,用户在输入拼音时不可避免地会犯错别字。此外,随着智能手机和移动互联网的普及,拼音错别字纠正已成为一项日益重要的任务。如何利用用户打字行为的知识并支持首字母拼音的错别字纠正仍然是一个具有挑战性的问题。为应对这些挑战,我们提出了KNPTC,一种基于神经机器翻译(NMT)的新方法。与以往工作相比,KNPTC能够将显式知识整合到NMT中以进行拼音错别字纠正,并且能够在无需人工选定约束或语言特定特征引导的情况下学习纠正多种错别字。在该方法中,我们首先基于大规模真实数据集获得相邻字母之间的转移概率。然后,利用这些概率构建训练句对的“真值”对齐。此外,将这些对齐整合到NMT中以捕捉合理的拼音错别字纠正模式。KNPTC被应用于真实数据集中的错别字纠正,与最先进(SOTA)系统相比,错别字纠正准确率平均提升了32.77%。

关键词

引用

@article{arxiv.1805.00741,
  title  = {KNPTC: Knowledge and Neural Machine Translation Powered Chinese Pinyin Typo Correction},
  author = {Hengyi Cai and Xingguang Ji and Yonghao Song and Yan Jin and Yang Zhang and Mairgup Mansur and Xiaofang Zhao},
  journal= {arXiv preprint arXiv:1805.00741},
  year   = {2018}
}

备注

7 pages, 3 figures