中文

真正优良的语法错误纠正的评估

计算与语言 2023-08-21 v1

摘要

尽管很少明言,在实践中,语法错误纠正(GEC)涵盖具有不同目标的各类模型,从语法错误检测到提升流畅度不一而足。传统评估方法未能充分捕捉系统能力与目标的全部范围。基于参考文献的评估在捕捉广泛可能纠正方式及参考创建中引入的偏差方面存在局限,且倾向于偏好修复局部错误而非整体文本改进。大语言模型(LLMs)的出现进一步凸显了这些评估策略的缺陷,强调了评估方法论范式转移的必要性。在当前研究中,我们使用最近发布的瑞典学习者文本数据集对各种 GEC 系统进行了全面评估。评估采用既定评估指标及人类评判进行。我们发现,在少样本设定下的 GPT-3 远远优于先前针对瑞典语的语法错误纠正系统,而瑞典语仅占其训练数据的 0.11%。我们还发现当前评估方法含有人类评估能够揭示的不当偏差。我们建议使用对 GEC 系统输出进行人工后编辑来分析达到母语者水平人类表现所需的改动量,并提供了一个标注有人类后编辑及对 GEC 系统输出的语法性、流畅度和意义保持度评估的数据集。

关键词

引用

@article{arxiv.2308.08982,
  title  = {Evaluation of really good grammatical error correction},
  author = {Robert Östling and Katarina Gillholm and Murathan Kurfalı and Marie Mattson and Mats Wirén},
  journal= {arXiv preprint arXiv:2308.08982},
  year   = {2023}
}