自动评分反高潮:AI短答能力短板与措辞弱点的元分析
计算与语言
2026-03-27 v2 计算机与社会
摘要
自动短答评分滞后于其他大语言模型应用。我们对 890 项最终结果进行元分析,这些结果涵盖对 LLM 短答评分研究的系统性综述,通过混合效应元回归模型对传统效应大小(Quadratic Weighted Kappa, QWK)进行量化。我们定量说明,人类专家执行评分儿童作品这一任务的难度水平对 LLM 性能没有观察到的统计效应。特别地,我们表明,一些在人类评分者眼中被测量为最容易的评分任务,却对 LLM 来说最为困难。无论是出于对有远见研究人员的不足,还是源于自回归训练模式,解码器模型平均低于编码器 0.37——这在人类一致性方面是一个显著差异。此外,我们衡量了 various LLM 技术方面对成功评分的贡献,如词汇表大小,该指标显示出递减的回报——可能源于未充分训练的标记。我们的发现主张应更好地预见自回归模型的已知统计短板。最后,我们提供额外实验说明措辞和标记化的敏感性以及在高风险教育情境中的偏见引发问题,其中 LLMs 显示出种族歧视。本研究的代码与数据均已公开。
关键词
引用
@article{arxiv.2603.04820,
title = {Autoscoring Anticlimax: A Meta-analytic Understanding of AI's Short-answer Shortcomings and Wording Weaknesses},
author = {Michael Hardy},
journal= {arXiv preprint arXiv:2603.04820},
year = {2026}
}