中文

像真正的导师一样用可视化关键点进行解释!多模态解答解释基准

计算与语言 2025-12-18 v5

摘要

随着大型语言模型(LLM)在数学推理能力方面的快速发展,AI 系统正越来越多地被用于支持学生理解问题解决过程。然而,当前 LLM 生成的解释中仍缺乏关键组成部分:多模态解释。在现实的教学情境中,人类导师会定期运用视觉辅助工具,如图表、标记和突出显示,以增强概念清晰度。为弥合这一差距,我们引入了多模态解答解释任务,旨在评估模型是否能识别视觉关键点(如辅助线、点、角度),并生成包含这些关键元素的解释,以帮助理解。为评估模型在此任务上的表现,我们提出了 ME2,一个包含 1000 题数学问题的多模态基准,每个问题都标注了视觉关键点及其对应的解释文本。我们的实证结果表明,当前模型在识别视觉关键点方面存在困难。在生成基于关键点的解释方面,开源模型也面临显著挑战。这凸显了当前 LLM 在执行数学视觉定位、进行视觉依存推理以及在教育情境中提供解释方面的重要差距。我们期待多模态解答解释任务和 ME2 数据集将催化进一步的研究,推动 LLM 在教育领域的应用,使其成为有效的解释导向 AI 导师。

关键词

引用

@article{arxiv.2504.03197,
  title  = {Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation},
  author = {Jaewoo Park and Jungyang Park and Dongju Jang and Jiwan Chung and Byungwoo Yoo and Jaewoo Shin and Seonjoon Park and Taehyeong Kim and Youngjae Yu},
  journal= {arXiv preprint arXiv:2504.03197},
  year   = {2025}
}

备注

14 pages, 9 figures