中文

CEC-Zero:基于自生成奖励的零监督字符纠错

计算与语言 2026-01-01 v1

摘要

大规模中文拼写纠错(CSC)对于现实世界的文本处理仍然至关重要,然而现有的 LLM 和监督方法对新型错误缺乏鲁棒性,且依赖昂贵的标注。我们提出了 CEC-Zero,一个零监督强化学习框架,通过使 LLM 纠正自身的错误来解决这一问题。CEC-Zero 从干净文本中合成带错误的输入,通过语义相似度和候选一致性计算簇一致性奖励,并使用 PPO 优化策略。它在 9 个基准测试中比监督基线高出 10--13 个 F1_1 分数,比强 LLM 微调高出 5--8 个分数,并具有无偏奖励和收敛的理论保证。CEC-Zero 为鲁棒、可扩展的 CSC 建立了无标签范式,释放了 LLM 在噪声文本流水线中的潜力。

关键词

引用

@article{arxiv.2512.23971,
  title  = {CEC-Zero: Zero-Supervision Character Error Correction with Self-Generated Rewards},
  author = {Zhiming Lin and Kai Zhao and Sophie Zhang and Peilai Yu and Canran Xiao},
  journal= {arXiv preprint arXiv:2512.23971},
  year   = {2026}
}

备注

AAAI'26 poster