中文

大型语言模型是语法纠错的最先进评估器

计算与语言 2024-05-28 v2

摘要

据报道,大型语言模型(LLM)在文本摘要和机器翻译等某些任务中已超越现有的自动评估指标。然而,关于 LLM 作为语法纠错(GEC)评估器的研究一直缺乏。在本研究中,我们通过采用旨在融入以往研究所启发的多种评估标准的提示,探究 LLM 在 GEC 评估中的表现。我们广泛的实验结果表明,GPT-4 与人类判断的 Kendall 秩相关系数达到 0.662,超越了所有现有方法。此外,在近期的 GEC 评估中,我们强调了 LLM 规模的重要性,并特别指出了流畅度在评估标准中的重要性。

关键词

引用

@article{arxiv.2403.17540,
  title  = {Large Language Models Are State-of-the-Art Evaluator for Grammatical Error Correction},
  author = {Masamune Kobayashi and Masato Mita and Mamoru Komachi},
  journal= {arXiv preprint arXiv:2403.17540},
  year   = {2024}
}

备注

Accepted to BEA workshop at NAACL 2024