中文

JELV:用于语法纠错评估与自动参考扩展的编辑级别有效性判官

计算与语言 2025-12-09 v2

摘要

现有的语法纠错(GEC)系统受限于参考多样性不足,导致评估被低估且模型泛化受限。为此,我们引入了编辑级别有效性判官(JELV),一个用于验证纠错编辑语法性、忠实性和流畅性的自动框架。使用我们提出的以人类标注为依据的成对编辑有效性数据集(PEVData)作为基准,JELV提供两种实现:实现与人类标注者90%一致性的多轮LLM评判管线,以及在有效编辑上达到85%精确度的蒸馏版DeBERTa分类器。我们随后将JELV应用于重新分类评估中被误判的假阳性,并通过整合假阳性分离和流畅性评分,构建综合评估指标,实现与人类判断的最高相关性。我们还将JELV应用于过滤LLM生成的纠错候选,扩展包含38,692个源句的BEA19单参考数据集。基于此扩展数据集训练的顶级GEC系统获得了可衡量的性能提升。JELV为增强参考多样性、加强评估和模型泛化提供了可扩展解决方案。

关键词

引用

@article{arxiv.2511.21700,
  title  = {JELV: A Judge of Edit-Level Validity for Evaluation and Automated Reference Expansion in Grammatical Error Correction},
  author = {Yuhao Zhan and Yuqing Zhang and Jing Yuan and Qixiang Ma and Zhiqi Yang and Yu Gu and Zemin Liu and Fei Wu},
  journal= {arXiv preprint arXiv:2511.21700},
  year   = {2025}
}