CL$^2$GEC:面向中文文学语法纠错的多学科持续学习基准
计算与语言
2025-09-18 v1 人工智能
摘要
日益增长的学术领域自动写作辅助需求凸显了需要能跨学科适应的鲁棒中文语法纠错(CGEC)系统的重要性。然而,现有 CGEC 研究缺乏针对多学科学术写作的专项基准,忽视了持续学习(CL)作为处理领域特定语言变异并防止灾难性遗忘的有前景解决方案。为填补这一关键空白,我们引入 CLGEC,作为中文文学语法纠错的首个持续学习基准,旨在评估跨多个学科领域的适应性 CGEC。本基准包含 1 万 条人工标注句子,涵盖 10 个学科,每个学科都呈现独特的语言风格与错误模式。CLGEC 聚焦于持续学习情境下的语法纠错评估,模拟不同学科的顺序性暴露,以反映真实编辑动态。我们在顺序调优、参数高效适应及四种代表性 CL 算法下评估大语言模型,采用标准 GEC 指标及适用于任务级变异的持续学习指标。实验结果表明,正则化方法在缓解遗忘方面优于重放法或朴素顺序方法。本基准为未来在多样化学术领域的自适应语法纠错研究提供了严谨基础。
引用
@article{arxiv.2509.13672,
title = {CL$^2$GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error Correction},
author = {Shang Qin and Jingheng Ye and Yinghui Li and Hai-Tao Zheng and Qi Li and Jinxiao Shan and Zhixing Li and Hong-Gee Kim},
journal= {arXiv preprint arXiv:2509.13672},
year = {2025}
}