中文

自动短答评分中的质量条件化一致性:中段性能下降及任务特定适应的影响

计算与语言 2026-05-26 v2 人工智能

摘要

自动短答评分(ASAS)正从基于判别的微调模型转向少量样本场景下的大语言模型(LLM)。这种范式利用LLM的广泛世界知识和部署便利性,但可能因任务特定数据有限而削弱在复杂评分任务上的对齐。在特别是对需要细致解读的部分正确响应评分方面,其影响尚未充分探讨。我们研究了不同模型的任务特定适应程度与质量条件化评分一致性之间的关系。我们将三个LLMs(GPT-5.2、GPT-4o、Claude Opus 4.5)在少量样本模式下、一个基于BERT的微调编码器以及人类专家,对比测试于两个开放性生物学题目,采用数百份学生作答及由生物学教育专家提供的真实评分。结果表明,人类-人类间的一致性在完整质量光谱中最高且稳定。所有AI模型在完全正确和完全错误的响应上表现良好,但在中段响应上出现显著下降。这种中段下降取决于任务特定适应:在少量样本LLMs中最为严重,随着任务特定数据增加而减轻,微调编码器模型性能最佳。这种中段下降可能导致对学生作答中途理解水平的评估产生不公平。我们的发现凸显了质量条件化公平性的重要性,尤其关注中段响应。

关键词

引用

@article{arxiv.2605.07647,
  title  = {Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation},
  author = {Abigail Victoria Gurin Schleifer and Moriah Ariely and Beata Beigman Klebanov and Asaf Salman and Giora Alexandron},
  journal= {arXiv preprint arXiv:2605.07647},
  year   = {2026}
}

备注

PRE-PRINT VERSION Accepted to ACL 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA26)