大语言模型语法纠错的多维评估
计算与语言
2026-05-11 v1
摘要
自动语法纠错助理已嵌入服务数百万学习者的教育平台,但该领域仍存在三个关键缺口:(1)最新一代大语言模型(LLMs)在语法纠错任务上缺乏全面评估;(2)是否将这些 LLMs 组合在一起可提高纠错质量尚未探讨;(3)参考基于指标低估 GEC 系统性能的程度尚未得到充分量化。本研究首先在编辑精度、流畅性保持和意义保持三个维度上评估最新一代 LLMs,表明经过微调的 GPT-4o 在所有三个维度上实现了最佳性能。其次,through 语法错误类型分析,我们展示单个 LLMs 在错误纠正模式中表现出高度相似性()。第三,我们表明,参考基于指标低估 GEC 性能,GPT-4o 的 73.76% 的纠正措施与黄金标准不同,却是等价甚至更优。这些 GEC 评估发现为教育者提供了指导,帮助其选择能促进而非限制学生语言发展的语法纠错助理。我们将使该数据、代码和模型公开可用。
引用
@article{arxiv.2605.07635,
title = {Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction},
author = {Adnan Labib and Qiao Wang and Yixuan Huang and Zheng Yuan},
journal= {arXiv preprint arXiv:2605.07635},
year = {2026}
}
备注
9 Pages