中文

AStar:通过自动化结构化思维增强多模态推理

计算与语言 2026-03-03 v5

摘要

多模态大语言模型在多个领域表现出色,但在复杂的视觉推理任务中仍面临困难。为了增强其推理能力,当前的方法通常依赖于显式搜索或后训练技术。然而,基于搜索的方法由于在解空间中进行大量探索而导致计算效率低下,而后训练方法需要大量数据和计算资源,且通常表现出训练不稳定性。为了应对这些挑战,我们提出了 AStar,一种用于多模态推理的无训练、自动化结构化思维范式。具体而言,我们引入了新颖的“思维卡片”,这是一种从先前样本中抽象出的高级推理模式的轻量级库。对于每个测试问题,AStar 自适应地检索最优思维卡片,并无缝地将这些外部显式指南与模型内部的隐式推理能力相结合。与以往的方法相比,AStar 消除了计算昂贵的显式搜索,避免了额外的复杂后训练过程,从而实现了一种更高效的推理方法。大量实验表明,我们的框架在 MathVerse 上达到了 53.9% 的准确率(超越 GPT-4o 的 50.2%),在 MathVision 上达到了 32.7%(超越 GPT-4o 的 30.4%)。进一步的分析揭示了我们方法的显著可迁移性:从数学推理生成的思维卡片也可以应用于其他推理任务,甚至有益于一般的视觉感知与理解。AStar 作为一种即插即用的测试时推理方法,与其他后训练技术兼容,为现有的多模态推理方法提供了重要补充。

关键词

引用

@article{arxiv.2502.02339,
  title  = {AStar: Boosting Multimodal Reasoning with Automated Structured Thinking},
  author = {Jinyang Wu and Mingkuan Feng and Guocheng Zhai and Shuai Zhang and Zheng Lian and Fangrui Lv and Pengpeng Shao and Ruihan Jin and Zhengqi Wen and Jianhua Tao},
  journal= {arXiv preprint arXiv:2502.02339},
  year   = {2026}
}

备注

Accepted by AAAI 2026 Oral