如果?基于世界模型的仿真情境推理
计算机视觉与模式识别
2026-03-09 v1
摘要
Situated reasoning 常依赖主动探索,但在许多实际场景中由于机器人物理限制或视觉障碍用户的安全顾虑,这种探索是不可行的。仅凭有限的观察,智能体能否在当前视角出发,脑海中模拟一条前往目标情境的未来轨迹,从而回答空间"如果"问题?我们引入 WanderDream,这是首个为仿真式探索而设计的大规模数据集,使模型能够在无需主动探索的情况下进行推理。WanderDream-Gen 包含 15.8K 条全景视频,覆盖 1,088 个真实场景(来自 HM3D、ScanNet++ 和真实场景捕获),描绘从当前视角到目标情境的想象轨迹。WanderDream-QA 包含 158K 条问答对,涵盖每条轨迹的起点、路径和终点,以全面评估基于探索的推理。通过世界模型和多模态大语言模型的大量实验表明:(1) 心理探索是 Situated reasoning 的关键;(2) 世界模型在 WanderDream-Gen 上取得卓越的性能;(3) 想象在 WanderDream-QA 的推理中显著提升效果;(4) WanderDream 数据在实际场景中展现出惊人的可迁移性。该项目的源代码和全部数据将公开释放。
引用
@article{arxiv.2603.06445,
title = {What if? Emulative Simulation with World Models for Situated Reasoning},
author = {Ruiping Liu and Yufan Chen and Yuheng Zhang and Junwei Zheng and Kunyu Peng and Chengzhi Wu and Chenguang Huang and Di Wen and Jiaming Zhang and Kailun Yang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2603.06445},
year = {2026}
}