中文

AtomThink:基于原子步骤推理的多模态慢思考

计算机视觉与模式识别 2026-01-12 v5 人工智能

摘要

在本文中,我们通过将“慢思考”概念引入多模态大型语言模型(MLLM)来解决多模态推理这一具有挑战性的任务。我们的核心思想是,模型可以学习自适应地使用不同级别的推理来解决不同复杂度的问题。我们提出了一种新颖的自结构化思维链范式,由最小语义原子步骤组成。与依赖结构化模板或自由形式范式的现有方法不同,我们的方法不仅能为各种复杂任务生成灵活的 CoT 结构,还能减轻在简单任务上过度思考的现象。为了将结构化推理引入视觉认知,我们设计了一个包含四个关键模块的新颖 AtomThink 框架:数据引擎,用于生成高质量的多模态推理路径;带有序列化推理数据的监督微调(SFT)过程;策略引导的多轮推理方法;以及用于评估单步利用率的原子能力指标。大量实验表明,所提出的 AtomThink 显著提升了基线 MLLM 的性能,在 MathVista 和 MathVerse 上实现了超过 10% 的平均准确率提升。与最先进的结构化 CoT 方法相比,我们的方法不仅实现了更高的准确率,还将数据利用率提高了 5 倍,并将推理效率提升了 85.3%。我们的代码已在 https://github.com/Kun-Xiang/AtomThink 公开发布。

关键词

引用

@article{arxiv.2411.11930,
  title  = {AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning},
  author = {Kun Xiang and Zhili Liu and Terry Jingchen Zhang and Yinya Huang and Yunshuang Nie and Kaixin Cai and Yiyang Yin and Runhui Huang and Hanhui Li and Yihan Zeng and Yu-Jie Yuan and Jianhua Han and Lanqing Hong and Hang Xu and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2411.11930},
  year   = {2026}
}

备注

TPAMI accepted