中文

CSCD-NS:面向母语者的中文拼写检查数据集

计算与语言 2024-05-24 v3 人工智能

摘要

本文提出 CSCD-NS,首个面向母语者的中文拼写检查(CSC)数据集,包含来自中文社交平台的 40,000 条样本。与现有面向中文学习者的 CSC 数据集相比,CSCD-NS 规模大十倍,且呈现出不同的错误分布,词级错误占比显著更高。为进一步丰富数据资源,我们提出一种新方法,通过输入法模拟输入过程,生成大规模且高质量的伪数据,其与实际错误分布高度接近,并优于现有方法。此外,我们考察了多种模型在该场景下的表现,包括 ChatGPT 等大型语言模型(LLM)。结果表明,由于严格的长度与发音约束,生成式模型表现不及 BERT 类分类模型。词级错误的高发性也使得面向母语者的 CSC 颇具挑战,仍存在较大改进空间。

关键词

引用

@article{arxiv.2211.08788,
  title  = {CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers},
  author = {Yong Hu and Fandong Meng and Jie Zhou},
  journal= {arXiv preprint arXiv:2211.08788},
  year   = {2024}
}