基于无训练LLM的通用中文字符纠错方法
计算与语言
2025-06-17 v2
摘要
中文拼写纠错(CSC)是旨在纠正中文文本中字符错误的关键任务。虽然传统CSC聚焦于由误输入导致的字符替代错误,但两种其他常见的字符错误类型——缺失字符和冗余字符——受到的关注较少。这些错误在标注过程中常被排除在CSC数据集之外,或在评估时被忽略,尽管它们可能已被标注。这一问题限制了CSC任务的实际应用。为此,我们提出通用中文字符纠错(C2EC)任务,聚焦于这三类字符错误。我们通过组合和手动验证CCTC和Lemon数据集,构建了高质量的C2EC基准。我们将无训练无提示CSC方法扩展至C2EC,采用Levenshtein距离处理长度变化,并利用额外的基于提示的大语言模型(LLM)提升性能。实验表明,我们的方法使14B参数的LLM在传统CSC和C2EC任务上性能与 nearly 50倍参数量的模型相当,无需任何微调。
引用
@article{arxiv.2502.15266,
title = {A Training-free LLM-based Approach to General Chinese Character Error Correction},
author = {Houquan Zhou and Bo Zhang and Zhenghua Li and Ming Yan and Min Zhang},
journal= {arXiv preprint arXiv:2502.15266},
year = {2025}
}
备注
Accepted at Main Conference of ACL 2025, 26 pages, 12 figures