中文

中文拼写检查的综合评估与分析研究

计算与语言 2023-07-26 v1

摘要

随着预训练模型的发展以及语音与字形信息的融入,神经模型在中文拼写检查(CSC)中已取得高分。然而,由于测试集有限,这并不能全面反映模型能力。本研究中,我们抽象出代表性模型范式,以九种结构实现之,并在我们构建的具有不同目的的综合测试集上实验。我们对结果进行详细分析并发现:1)合理融合语音与字形信息对CSC有效。2)模型对测试集的错误分布敏感,这反映了模型不足并揭示了应努力的方向。3)错误与上下文是否曾被见过对模型有显著影响。4)常用基准SIGHAN无法可靠评估模型性能。

关键词

引用

@article{arxiv.2307.13655,
  title  = {A Comprehensive Evaluation and Analysis Study for Chinese Spelling Check},
  author = {Xunjian Yin and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2307.13655},
  year   = {2023}
}