运用多模态大语言模型对手写工程考试进行评分
计算机视觉与模式识别
2026-01-05 v1
摘要
手写 STEM 考试捕捉了开放性推理和图表,但手动评分速度慢且难以扩展。我们提出了一套用于对扫描后的手写工程小测验进行评分的端到端工作流程,采用多模态大语言模型(LLM),在保留标准考试流程(A4 纸张、学生手写内容不受限制)的前提下实现评分。教师只需提供手写参考解答(100%)和一套简短的评分规则;参考解答被转换为仅含文本的摘要,以用于条件化评分,而无需暴露参考解答的扫描件。通过多阶段设计实现可靠性,其中包括格式/存在性检查以防止对空答案进行评分,采用独立评分器的集成、监督聚合,以及严格的模板和确定性验证,以生成可审计、机器可解析的报告。我们在干净室协议下,对 held-out 真实课程小测验(包括手绘电路原理图)进行评估。采用最先进的后端(GPT-5.2 和 Gemini-3 Pro),完整流程实现约 8 分的平均绝对差异,偏差低,在 时估计的手动复审触发率约为 17%。消融实验表明,仅使用简单提示和移除参考解答会显著降低准确率并引入系统性高评分,确认结构化提示和参考依托是必不可少的。
引用
@article{arxiv.2601.00730,
title = {Grading Handwritten Engineering Exams with Multimodal Large Language Models},
author = {Janez Perš and Jon Muhovič and Andrej Košir and Boštjan Murovec},
journal= {arXiv preprint arXiv:2601.00730},
year = {2026}
}
备注
10 pages, 5 figures, 2 tables. Supplementary material available at https://lmi.fe.uni-lj.si/en/janez-pers-2/supplementary-material/