大语言模型与人类评分员在作文评分中的一致性:研究综述
计算与语言
2026-05-27 v2
摘要
尽管大语言模型(LLMs)在自动作文评分(AES)中展现出巨大的潜力,但关于其可靠性是否优于人类评分员的实证发现仍不一致。遵循PRISMA 2020指南,我们综合了2022年1月至2025年8月期间发表和未发表的65项研究,考察LLM生成的评分与人类评分之间的一致性。一致性水平在不同研究之间以及单个研究内部差异很大,报告的数值跨越了很广的范围。总体而言,发现表明LLM与人类之间的一致性高度依赖具体情境。讨论了影响、挑战以及未来研究的方向。
引用
@article{arxiv.2512.14561,
title = {Agreement Between Large Language Models and Human Raters in Essay Scoring: A Research Synthesis},
author = {Hongli Li and Che Han Chen and Kevin Fan and Chiho Young-Johnson and Soyoung Lim and Yali Feng},
journal= {arXiv preprint arXiv:2512.14561},
year = {2026}
}