中文

面向中文拼写纠错的抗错检索方法

计算与语言 2024-02-27 v2

摘要

中文拼写检查(CSC)旨在检测并纠正中文语境中的错误字符,具有广泛的应用。然而,它面临着标注数据不足的挑战,且先前的方法可能实际上并未充分利用现有数据集。本文中,我们提出了一种即插即用的、带有抗错信息的面向中文拼写检查的检索方法(RERIC),可直接应用于现有 CSC 模型。用于检索的数据存储完全基于训练数据构建,并依据 CSC 的特点进行了精心设计。具体而言,我们在检索的查询与键计算过程中采用融合语音、形体和上下文信息的多模态表示,以增强对潜在错误的鲁棒性。此外,为更好地判断检索到的候选,将待检查字符周围的 n-gram 作为值并用于特定的重排序。在 SIGHAN 基准上的实验结果表明,我们提出的方法相比现有工作取得了显著提升。

关键词

引用

@article{arxiv.2211.07843,
  title  = {Error-Robust Retrieval for Chinese Spelling Check},
  author = {Xunjian Yin and Xinyu Hu and Jin Jiang and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2211.07843},
  year   = {2024}
}

备注

11 pages, 3 figures