中文

原子步骤分解能否增强多模态大模型的自结构化推理?

计算机视觉与模式识别 2025-08-04 v1 人工智能

摘要

在本文中,我们通过将“慢思考”能力引入多模态大语言模型 (MLLMs) 来解决多模态数学推理这一具有挑战性的任务。我们的核心思想是,不同层次的推理能力可以动态结合,以应对不同复杂度的问题。为此,我们提出了一种由最小语义原子步骤组成的自结构化思维链 范式。与依赖结构化模板或自由形式范式的现有方法不同,我们的方法不仅能为各种复杂任务生成认知 CoT 结构,还能缓解过度思考现象。为了将结构化推理能力引入视觉理解模型,我们进一步设计了一个包含四个关键模块的新型 AtomThink 框架: 数据引擎,用于生成高质量的多模态推理路径; 带有序列化推理数据的监督微调过程; 策略引导的多轮推理方法; 原子能力度量,用于评估单步利用率。我们进行了大量实验,表明所提出的 AtomThink 显著提升了基线 MLLMs 的性能,在 MathVista 和 MathVerse 上实现了超过 10% 的平均准确率提升。与最先进的结构化 CoT 方法相比,我们的方法不仅获得了更高的准确率,还将数据利用率提高了 5 倍,并将推理效率提升了 85.3%。我们的代码现已在 https://github.com/Quinn777/AtomThink 公开。

关键词

引用

@article{arxiv.2503.06252,
  title  = {Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?},
  author = {Kun Xiang and Zhili Liu and Zihao Jiang and Yunshuang Nie and Kaixin Cai and Yiyang Yin and Runhui Huang and Haoxiang Fan and Hanhui Li and Weiran Huang and Yihan Zeng and Yu-Jie Yuan and Jianhua Han and Lanqing Hong and Hang Xu and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2503.06252},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2411.11930