VisTIRA:通过结构化工具集成解决视觉数学推理中的图像-文本模态鸿沟
人工智能
2026-03-18 v2 计算与语言
机器学习
摘要
视觉语言模型(VLMs)在数学推理方面落后于文本模型,尤其当问题以图像形式呈现时。我们经验性地表征了这一模态鸿沟:同一问题以文本形式会得到显著更高的准确率,而其视觉排版版本则因阅读密集公式、版面布局以及混合符号-图示语境等问题而表现较差。首先,我们引入 VisTIRA(Vision and Tool-Integrated Reasoning Agent),一个集成工具的推理框架,使其能够通过迭代分解给定的数学问题(作为图像)为自然语言论述和可执行的 Python 步骤,从而确定最终答案。其次,我们构建了一个框架来衡量和改进视觉数学推理:一个基于 LaTeX 的管道将链式思维数学语料库(如 NuminaMath)转换为具备挑战性的图像版本,并从真实世界的作业式图像数据集(称为 SnapAsk)中派生出大量合成工具使用轨迹,用于微调 VLMs。我们的实验表明,工具集成的监督可改善基于图像的推理,OCR grounding 进一步缩小较小模型的鸿沟,但在大规模模型中其效用会减弱。这些发现表明,模态鸿沟的严重程度与模型规模呈反相关,而结构化推理和 OCR-based grounding 是推进视觉数学推理的互补策略。
引用
@article{arxiv.2601.14440,
title = {VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration},
author = {Saeed Khaki and Ashudeep Singh and Nima Safaei and Kamal Ginotra},
journal= {arXiv preprint arXiv:2601.14440},
year = {2026}
}