中文

上下文相似度比字符相似度更有价值:中文拼写检查的一项实证研究

计算与语言 2023-03-02 v3

摘要

中文拼写检查(CSC)任务旨在检测并纠正中文拼写错误。近来相关研究侧重于从混淆集引入字符相似度以增强 CSC 模型,却忽略了包含更丰富信息的字符上下文。为更好地利用上下文信息,我们提出了一种简单而有效的面向 CSC 任务的课程学习(CL)框架。借助我们与模型无关的 CL 框架,现有 CSC 模型将像人类学习汉字一样由易到难地训练,并取得进一步的性能提升。在广泛使用的 SIGHAN 数据集上的大量实验与细致分析表明,我们的方法优于以往最先进(SOTA)的方法。更具启发性的是,我们的研究从经验上表明,对于 CSC 任务,上下文相似度比字符相似度更有价值。

关键词

引用

@article{arxiv.2207.09217,
  title  = {Contextual Similarity is More Valuable than Character Similarity: An Empirical Study for Chinese Spell Checking},
  author = {Ding Zhang and Yinghui Li and Qingyu Zhou and Shirong Ma and Yangning Li and Yunbo Cao and Hai-Tao Zheng},
  journal= {arXiv preprint arXiv:2207.09217},
  year   = {2023}
}

备注

Accepted by ICASSP2023