中文

DrawEduMath:面向教育场景的学生手绘数学图像评估数据集

计算与语言 2025-01-28 v1 计算机视觉与模式识别

摘要

在实际应用场景中,视觉语言模型(VLM)应能稳健处理自然且噪声较大的视觉内容以及领域特定的语言和概念。例如,K-12 教育工作者在数字学习平台上需要检查和反馈大量学生数学作品的图像。为评估 VLM 在此类场景中的潜力,我们引入 DrawEduMath——一个由 2,030 张学生手写作答 K-12 数学题目图像组成的英语数据集。教师提供了详细的注释,包括每张图像的自由形式描述和 11,661 组问答(QA)对。这些注释捕捉了丰富的教育见解,涵盖学生的解题策略、绘图、图表和书写构成。我们在教师提供的 QA 对以及 44,362 组由教师描述生成的合成 QA 对上评估了 VLM 的表现。我们表明,即便是最先进的 VLM 在 DrawEduMath 问题上仍有很大提升空间。我们也发现,尽管合成 QA 不完美,但它们可产生与教师撰写的 QA 类似的模型排序。我们发布 DrawEduMath 以支持评估 VLM 在教育语境下对图像进行数学推理的能力。

关键词

引用

@article{arxiv.2501.14877,
  title  = {DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images},
  author = {Sami Baral and Li Lucy and Ryan Knight and Alice Ng and Luca Soldaini and Neil T. Heffernan and Kyle Lo},
  journal= {arXiv preprint arXiv:2501.14877},
  year   = {2025}
}

备注

19 pages, 10 figures, Accepted to NAACL 2025