多模态数学推理综述:从感知、对齐到推理
人工智能
2026-04-15 v3
摘要
多模态数学推理 (MMR) 近期因其解决包含文本与视觉两种模态的数学问题的能力而受到越来越多的关注。然而,当前模型在实际视觉数学任务中仍面临诸多挑战,常常误解图图,无法将数学符号与视觉证据对齐,或产生不一致的推理步骤。此外,现有的评估主要关注检查最终答案,而非验证每一步中间推理的正确性或可执行性。近期大量研究通过整合结构化感知、显式对齐和可验证的推理,构建统一框架以解决上述问题。为建立清晰的路线图以理解和比较不同的 MMR 方法,本文围绕四个根本问题进行系统性综述:(1) 从多模态输入中提取什么信息;(2) 如何表示和对齐文本与视觉信息;(3) 如何进行推理;(4) 如何评估整个推理过程的正确性。最后,本文讨论开放挑战并分享未来研究方向的思考。
引用
@article{arxiv.2603.08291,
title = {A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning},
author = {Tianyu Yang and Sihong Wu and Yilun Zhao and Zhenwen Liang and Lisen Dai and Chen Zhao and Minhao Cheng and Arman Cohan and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2603.08291},
year = {2026}
}
备注
ACL 2026