中文

基于流畅度的多参考语法纠错评估的形式框架

计算与语言 2025-10-09 v1

摘要

语法纠错评估需要能够反映有效人类纠正多样性的指标,而不是偏向单个参考。现有的框架主要基于编辑且以英语为中心,依赖系统与参考编辑之间的刚性对齐,限制了其在多语言和生成式场景中的适用性。本文引入一种用于流畅度导向多参考评估的形式框架,将 n-gram 相似性作为在多个合法纠正掩饰上的聚合问题。在此框架下,我们通过四种聚合策略——select-best、simple-average、weighted-average 和 merged-counts——实例化 GLEU,并分析其有界性、单调性和对参考变异的敏感性。实验结果表明,这些策略在捕捉流畅度和覆盖率的不同方面具有互补性。该框架将多参考评估统一为一种原则性、以流畅度为导向的方法,无需惩罚合法变异即可纳入语言多样性。

关键词

引用

@article{arxiv.2510.06749,
  title  = {A Formal Framework for Fluency-based Multi-Reference Evaluation in Grammatical Error Correction},
  author = {Eitan Klinger and Zihao Huang and Tran Minh Nguyen and Emma Jayeon Park and Yige Chen and Yang Gu and Qingyu Gao and Siliang Liu and Mengyang Qiu and Jungyeul Park},
  journal= {arXiv preprint arXiv:2510.06749},
  year   = {2025}
}

备注

Submitted to ACL Rolling Review - October 2025 for EACL 2026