DrawEduMath 后的冲击:视觉语言模型在劣势学生身上表现不佳并误诊误判
计算与语言
2026-03-03 v1 计算机视觉与模式识别
计算机与社会
摘要
有效的数学教育需要识别并应对学生的错误。为AI支持教育应用,模型需在不同学生水平下表现良好。我们提供了11个视觉语言模型(VLM)在DrawEduMath上的全面评估,该基准包含真实学生手写/手绘作答的数学问答。我们发现,VLM的弱点集中于核心教育环节:学生错误。所有评估的VLM在描述需要更多教学支持的学生作答时均表现不佳,所有问答任务中均在评估学生错误方面最为薄弱。尽管VLM可能被优化为数学解题专家,但我们的实验结果表明,其发展方向需转向支持教育场景的替代目标。
关键词
引用
@article{arxiv.2603.00925,
title = {The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors},
author = {Li Lucy and Albert Zhang and Nathan Anderson and Ryan Knight and Kyle Lo},
journal= {arXiv preprint arXiv:2603.00925},
year = {2026}
}
备注
15 pages, 10 figures