MindJourney:基于世界模型的测试时空间推理扩展
计算机视觉与模式识别
2025-11-04 v2 人工智能
机器人学
摘要
3D 空间中的空间推理是人类认知的核心,也是具身任务(如导航和操作)不可或缺的能力。然而,当前领先的视觉-语言模型 (VLM) 在执行诸如预测机械运动后场景外观等简单任务时常常难以办理:它们感知 2D 图像,却缺乏对3D 动力学的内部模型。为此,我们提出了 MindJourney,一种测试时扩展框架,为 VLM 注入这一缺失能力,通过将其与基于视频扩散的可控世界模型耦合实现。VLM 不断绘制简洁的相机轨迹,而世界模型在每一步生成相应的视图。VLM 随后对在交互式探索期间收集的多视图证据进行推理。无需任何微调,我们的 MindJourney 在代表性空间推理基准 SAT 上实现了平均7.7% 的性能提升,表明以世界模型为VLM 提供测试时扩展是实现稳健3D 推理的简单、即插即用的途径。与此同时,我们的方法也超越了通过强化学习训练的测试时 VLM,展示了利用世界模型进行测试时扩展的潜力。
引用
@article{arxiv.2507.12508,
title = {MindJourney: Test-Time Scaling with World Models for Spatial Reasoning},
author = {Yuncong Yang and Jiageng Liu and Zheyuan Zhang and Siyuan Zhou and Reuben Tan and Jianwei Yang and Yilun Du and Chuang Gan},
journal= {arXiv preprint arXiv:2507.12508},
year = {2025}
}
备注
Project Page: https://umass-embodied-agi.github.io/MindJourney