EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学STEM学生手写解答上的表现
摘要
多模态大语言模型(MLLMs)在革新传统教育和减轻教师工作负担方面具有巨大潜力。然而,由于缺乏真实且领域特定的基准,准确解读包含交织的数学公式、图表和文本推理的无约束STEM学生手写解答构成了重大挑战。此外,当前的评估范式主要依赖于下游任务(如自动评分)的结果,这通常只探测已识别内容的一部分,从而未能捕捉MLLMs对复杂手写逻辑的整体理解。为弥补这一差距,我们发布了EDU-CIRCUIT-HW,一个包含来自大学STEM课程的1300多份真实学生手写解答的数据集。利用经过专家验证的学生解答的逐字转录和评分报告,我们同时评估了各种MLLMs的上游识别保真度和下游自动评分性能。我们的评估揭示了MLLMs识别的学生手写内容中存在惊人规模的潜在失败,突显了模型在高风险教育环境中用于自动评分和其他理解导向应用时的可靠性不足。作为潜在解决方案,我们提供了一个案例研究,证明利用识别出的错误模式来预先检测和纠正识别错误,同时仅需最少的人工干预(例如,将3.3%的作业分配给人工评分员,其余分配给GPT-5.1评分员),可以有效增强部署的AI辅助评分系统的鲁棒性。代码和数据集可在以下GitHub仓库获取:https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL。
引用
@article{arxiv.2602.00095,
title = {EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions},
author = {Weiyu Sun and Liangliang Chen and Yongnuo Cai and Huiru Xie and Yi Zeng and Ying Zhang},
journal= {arXiv preprint arXiv:2602.00095},
year = {2026}
}
备注
Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL