中文

基于无训练LLM的通用中文字符纠错方法

计算与语言 2025-06-17 v2

摘要

中文拼写纠错(CSC)是旨在纠正中文文本中字符错误的关键任务。虽然传统CSC聚焦于由误输入导致的字符替代错误,但两种其他常见的字符错误类型——缺失字符和冗余字符——受到的关注较少。这些错误在标注过程中常被排除在CSC数据集之外,或在评估时被忽略,尽管它们可能已被标注。这一问题限制了CSC任务的实际应用。为此,我们提出通用中文字符纠错(C2EC)任务,聚焦于这三类字符错误。我们通过组合和手动验证CCTC和Lemon数据集,构建了高质量的C2EC基准。我们将无训练无提示CSC方法扩展至C2EC,采用Levenshtein距离处理长度变化,并利用额外的基于提示的大语言模型(LLM)提升性能。实验表明,我们的方法使14B参数的LLM在传统CSC和C2EC任务上性能与 nearly 50倍参数量的模型相当,无需任何微调。

关键词

引用

@article{arxiv.2502.15266,
  title  = {A Training-free LLM-based Approach to General Chinese Character Error Correction},
  author = {Houquan Zhou and Bo Zhang and Zhenghua Li and Ming Yan and Min Zhang},
  journal= {arXiv preprint arXiv:2502.15266},
  year   = {2025}
}

备注

Accepted at Main Conference of ACL 2025, 26 pages, 12 figures