多模态大语言模型能读懂学生的心思吗?——手写数学作业中的多模态错误分析
人工智能
2026-03-27 v1 计算与语言
计算机视觉与模式识别
摘要
评估学生的手写草稿对于个性化教育反馈至关重要,但由于 handwriting 的多样性、复杂的布局和多样化的解题方法,这带来了独特的挑战。现有的教育自然语言处理主要关注文本回答,而忽略了真实手写草稿中固有的复杂性和多模态性。当前的多模态大语言模型(MLLMs)擅长视觉推理,但通常采用“应试者视角”,优先考虑生成正确答案而不是诊断学生错误。为了弥补这些差距,我们引入了ScratchMath,这是一个新颖的基准测试,专门用于解释和分类真实手写数学草稿中的错误。我们的数据集包含来自中国中小学学生的1,720个数学样本,支持两个关键任务:错误原因解释(ECE)和错误原因分类(ECC),定义了七种错误类型。该数据集通过严格的人机协作方法进行了细致标注,涉及专家标记、审查和验证的多个阶段。我们在ScratchMath上系统评估了16个领先的MLLMs,揭示了它们与人类专家相比存在显著的性能差距,尤其是在视觉识别和逻辑推理方面。专有模型明显优于开源模型,大型推理模型在错误解释方面显示出强大的潜力。所有评估数据和框架均已公开,以促进进一步研究。
引用
@article{arxiv.2603.24961,
title = {Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math},
author = {Dingjie Song and Tianlong Xu and Yi-Fan Zhang and Hang Li and Zhiling Yan and Xing Fan and Haoyang Li and Lichao Sun and Qingsong Wen},
journal= {arXiv preprint arXiv:2603.24961},
year = {2026}
}
备注
Accepted by the 27th International Conference on Artificial Intelligence in Education (AIED'26)