衡量重要之物——还是便利之物?LLM 评分系统对构造无关因素的鲁棒性
计算与语言
2026-03-27 v1 人工智能
计算机与社会
摘要
自动化系统已在教育测试行业广泛用于开放性回答评估和作文评分。这些系统通常达到与训练有素的人工评分者相当甚至更优的性能水平,但已被反复证明容易受到构造无关因素(即与所评估构造无关的回答特征)和对抗条件的影响。随着大语言模型在自动化评分系统中的日益使用,人们对这些基于 LLM 的自动化评分方法面对构造无关因素的鲁棒性给予了新的关注。本研究调查了构造无关因素对一种双架构 LLM 评分系统的影响,该系统旨在对情境判断测试中的短篇作文式开放性回答项目进行评分。结果表明,该评分系统通常对用无意义文本填充回答、拼写错误和写作复杂度具有鲁棒性。将大段文本重复复制会导致系统预测的分数平均降低,这与之前非 LLM 评分系统的研究结果相矛盾,而偏离主题的则受到评分系统的严厉惩罚。这些结果为未来以构造相关性为设计原则的 LLM 评分系统的鲁棒性提供了令人鼓舞的支持。
引用
@article{arxiv.2603.25674,
title = {Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors},
author = {Cole Walsh and Rodica Ivan},
journal= {arXiv preprint arXiv:2603.25674},
year = {2026}
}
备注
Shortened version of this paper accepted to AIED 2026; experiment 3 was omitted from accepted paper due to space restrictions