自动作文评分是否已达到足够准确性?基于古典测验理论推导可实现的 QWK 上限
人工智能
2026-04-22 v1
摘要
自动作文评分 (AES) 通常在公共基准数据集上使用二次加权 kappa (QWK) 进行评估。然而,由于基准标签由人类评分员给出且必然包含评分误差,仍不清楚 QWK 的理论可达上限以及实际部署所需的足够水平。因此,我们基于古典测验理论中的可靠性概念,推导了两个数据集特定的 QWK 上限,这些上限可从标准的双评分基准数据集中估计,无需额外标注。第一个是理论上限:在标签噪声下,完美预测潜在真实得分的理想 AES 模型可达到的最大 QWK。第二个是人类水平上限:具有人类水平评分误差的 AES 模型可达到的 QWK,为 AES 旨在取代单位人类评分员时提供了实际目标。我们进一步指出,常用于上限参考的人类--人类 QWK 可能低估真实上限。仿真实验验证了所提出的上限方法,真实基准数据的实验则阐明了这些上限如何澄清当前 AES 模型的性能与剩余潜力。
关键词
引用
@article{arxiv.2604.19131,
title = {Has Automated Essay Scoring Reached Sufficient Accuracy? Deriving Achievable QWK Ceilings from Classical Test Theory},
author = {Masaki Uto},
journal= {arXiv preprint arXiv:2604.19131},
year = {2026}
}
备注
Accepted for publication at AIED 2026 (full paper)