中文

CLFEC:面向中文专业写作的统一语言与事实错误纠正任务

计算与语言 2026-03-02 v1

摘要

中文文本纠错传统上侧重拼写和语法,而事实错误纠正通常独立处理。然而,在段落级中文专业写作中,语言错误(词/语法/标点)与事实错误频繁发生且相互交织,统一纠正既必要又具有挑战性。本文提出CLFEC(Chinese Linguistic & Factual Error Correction),即中文语言与事实错误纠正,是一个用于联合纠正的新任务。我们构建了一个涵盖当前事务、金融、法律和医疗等多个领域的混合、多域中文专业写作数据集。随后,我们系统研究了基于大语言模型的纠正范式,从提示工程到检索增强生成(RAG)以及智能体工作流程。分析结果揭示了实际挑战,包括专业纠正模型的泛化能力受限、事实修复需要证据 grounding、混合错误段落的困难,以及对干净输入的过度纠正。进一步结果表明,在同一语境中处理语言与事实错误的效果优于解耦流程,智能体工作流程在合适的底层模型支持下也能有效。总体而言,我们的数据集和实证发现为构建工业环境中可靠的全自动校对系统提供了指导。

关键词

引用

@article{arxiv.2602.23845,
  title  = {CLFEC: A New Task for Unified Linguistic and Factual Error Correction in paragraph-level Chinese Professional Writing},
  author = {Jian Kai and Zidong Zhang and Jiwen Chen and Zhengxiang Wu and Songtao Sun and Fuyang Li and Yang Cao and Qiang Liu},
  journal= {arXiv preprint arXiv:2602.23845},
  year   = {2026}
}