中文

MathCanvas:多模态数学推理的内在视觉链式思维

计算机视觉与模式识别 2025-10-17 v1 计算与语言

摘要

虽然大型语言模型(LLMs)在文本推理方面表现出色,但在依赖视觉辅助的数学领域(如几何)方面仍感到困难。现有的视觉链式思维(VCoT)方法常受限于僵化的外部工具,或无法生成复杂问题解决所必需的高保真、策略性时机的图示。为弥合这一差距,我们提出MathCanvas,一个为统一的大型多模态模型(LMM)赋予内在VCoT能力的全面框架。我们的方法包含两个阶段:首先,视觉操作阶段在新颖的 15.2M 对语料库上预训练,包括 1000 万对描述到图示配对(MathCanvas-Imagen)和 520 万对逐步编辑轨迹(MathCanvas-Edit),以掌握图示生成与编辑。其次,战略视觉辅助推理阶段在 MathCanvas-Instruct 的新 219 万例数据集上微调,教导其何时如何利用视觉辅助。为便于严格评估,我们引入MathCanvas-Bench,一个包含 3000 题需模型生成交错视觉-文本解答的挑战性基准。我们的方法BAGEL-Canvas在MathCanvas-Bench上相较于强大LMM基线实现了 86% 的相对改进,展现出对其他公开数学基准的优异泛化能力。我们的工作提供了一个完整的工具-框架、数据集和基准,解锁LMM中复杂的人类化视觉辅助推理能力。项目页面: https://mathcanvas.github.io/

关键词

引用

@article{arxiv.2510.14958,
  title  = {MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning},
  author = {Weikang Shi and Aldrich Yu and Rongyao Fang and Houxing Ren and Ke Wang and Aojun Zhou and Changyao Tian and Xinyu Fu and Yuxuan Hu and Zimu Lu and Linjiang Huang and Si Liu and Rui Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2510.14958},
  year   = {2025}
}

备注

Project Page: https://mathcanvas.github.io/