VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
计算与语言
2025-04-15 v1
摘要
最近的大型视觉语言模型 (LVMM) 取得了显著的能力,但在面对需要人类通常通过视觉辅助和逐步思考来解决的复杂推理任务时,往往会失灵。虽然现有方法探索了基于文本的慢思考或粗糙的视觉辅助,但不足以捕捉人类视觉-语言推理过程中交错不规则的本质。为克服这些限制并受人类认知中慢思考机制的启发,我们引入 VisuoThink,一个新框架,无缝集成视觉空间和语言领域。VisuoThink 通过实现渐进的视觉-文本推理,实现了多模态慢思考,并通过前瞻树搜索实现了推理时间的扩展。大量实验表明,VisuoThink 通过推理时间的扩展显著提升了推理能力,尽管未进行微调,即可在几何和空间推理任务中实现最先进的性能。
引用
@article{arxiv.2504.09130,
title = {VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search},
author = {Yikun Wang and Siyin Wang and Qinyuan Cheng and Zhaoye Fei and Liang Ding and Qipeng Guo and Dacheng Tao and Xipeng Qiu},
journal= {arXiv preprint arXiv:2504.09130},
year = {2025}
}
备注
12 pages