MindJourney:基于世界模型的测试时扩展空间推理
机器学习
2025-07-18 v1 人工智能
计算与语言
摘要
3D 空间中的空间推理是人类认知的核心,对导航和操控等具身任务至关重要。然而,当前最先进的视觉语言模型 (VLM) 在执行诸如预测 egocentric 运动后场景外观等简单任务时常常难以为继:它们感知 2D 图像,却缺乏 3D 动力学的内部模型。为此,我们提出了 MindJourney,一种测试时扩展框架,为 VLM 注入了这一缺失功能,通过将其与基于视频扩散的可控世界模型耦合。VLM 不断勾勒简洁的相机轨迹,而世界模型在每一步合成相应的视图。VLM 然后对在交互式探索期间收集的多视角证据进行推理。毫无微调地,我们的 MindJourney 在代表性空间推理基准 SAT 上实现了平均 7.7% 的性能提升,表明以世界模型为测试时扩展搭配 VLM 为提供简单、即插即用的稳健 3D 推理路径。与此同时,我们的方法也超越了通过强化学习训练的测试时 VLM,显示了利用世界模型进行测试时扩展潜力的前景。
引用
@article{arxiv.2507.12507,
title = {Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training},
author = {Mingjie Liu and Shizhe Diao and Jian Hu and Ximing Lu and Xin Dong and Hao Zhang and Alexander Bukharin and Shaokun Zhang and Jiaqi Zeng and Makesh Narsimhan Sreedhar and Gerald Shen and David Mosallanezhad and Di Zhang and Jonas Yang and June Yang and Oleksii Kuchaiev and Guilin Liu and Zhiding Yu and Pavlo Molchanov and Yejin Choi and Jan Kautz and Yi Dong},
journal= {arXiv preprint arXiv:2507.12507},
year = {2025}
}
备注
14 pages, 7 figures