设计可靠的 LLM 辅助评分标准:基于物理考试的实证研究
人工智能
2026-04-15 v1 计算与语言
摘要
STEM 评估中的学生响应往往是手写形式,融合符号表达式、计算与图示,导致格式与解释存在显著变异。尽管这些响应在评估学生推理能力方面至关重要,但因评分耗时且在部分给分情境下易产生评分者不一致,故仍备受关注。近期大语言模型 (LLM) 的进步推动了 AI 辅助评分的关注,但关于评分标准设计与 LLM 配置如何影响不同绩效水平可靠性的实证研究仍有限。本研究考察了使用 GPT-4o 对 undergraduate 物理构造性响应进行 AI 辅助评分的可靠性。在两轮评分中,四名 instructor 与 AI 模型分别采用不同层次细化程度的基于技能的评分标准进行评分。系统地变更了提示格式与温度设置。总体而言,人类-AI 在总体得分上的一致性相当于人类评分者之间的可靠性,且在高绩效与低绩效响应方面一致性最高,但在涉及部分或模糊推理的中等水平响应方面表现下降。在项目层面分析中,明确定义的概念技能的对齐程度高于扩展的程序性判断。更细致的、清单式评分标准相对于整体评分方式提高了一致性。这些发现表明,可靠的 AI 辅助评分主要取决于清晰且结构完善的评分标准,而提示格式在次要作用,温度设置的影响相对有限。更广泛地说,本研究为通过基于技能的评分标准与受控 LLM 设置,在 STEM 语境中实施可靠的 LLM 辅助评分提供了可移植的设计建议。
引用
@article{arxiv.2604.12227,
title = {Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams},
author = {Xiuxiu Tang and G. Alex Ambrose and Ying Cheng},
journal= {arXiv preprint arXiv:2604.12227},
year = {2026}
}