Socratic-MCTS:通过正确提问实现测试时视觉推理
计算机视觉与模式识别
2025-06-11 v1 人工智能
计算与语言
摘要
近期视觉-语言模型(VLMs)的研究围绕为其赋予隐式长链式推理能力的可能性展开——类似于语言模型中通过蒸馏和强化学习取得的成功。但对于那些已在互联网上训练并部署的非推理模型,我们是否应直接放弃,还是存在一种搜索机制能够在无需额外训练或监督的情况下激发隐藏知识并诱导长推理轨迹?在本文中,我们利用一种蒙特卡洛树搜索(MCTS)启发的算法探索这一可能性,该算法将子问题-子答案对注入模型的输出流。我们表明,将推理框定为搜索过程——其中子问题作为更广泛推理轨迹中的潜在决策——有助于模型在碎片化知识之间"建立联系",并在非推理模型中产生扩展的推理轨迹。我们在三个基准上评估了所提方法,观察到一致的改进。特别地,我们的方法在MMMU-PRO上取得了2%的整体提升,其中人文学科获得了显著的9%提升。
引用
@article{arxiv.2506.08927,
title = {Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions},
author = {David Acuna and Ximing Lu and Jaehun Jung and Hyunwoo Kim and Amlan Kar and Sanja Fidler and Yejin Choi},
journal= {arXiv preprint arXiv:2506.08927},
year = {2025}
}