中文

通过测试时扩展探测世界模型在空间推理中的有效性

计算机视觉与模式识别 2025-12-08 v1 人工智能

摘要

视觉-语言模型(VLMs)在需要多视角理解和具身视角转换的空间推理任务中仍然存在局限。近期方法如MindJourney试图通过测试时扩展来弥补这一差距,即世界模型想象动作条件下的轨迹,而启发式验证器从这些轨迹中选择有用的视角。在本工作中,我们系统地研究了此类测试时验证器在基准测试中的行为,揭示了其前景与缺陷。我们的不确定性分析表明,MindJourney的验证器几乎没有提供有意义的校准,而随机评分通常也能同等程度地降低答案熵,从而暴露出系统性的动作偏差和不可靠的奖励信号。为缓解这些问题,我们引入了一种通过空间断言进行验证(ViSA)框架,将测试时奖励建立在可验证的、帧锚定的微观声明之上。该原则性验证器在SAT-Real基准上持续改善空间推理,并通过更平衡的探索行为纠正轨迹选择偏差。然而,在具有挑战性的MMSI-Bench上,包括我们在内的所有验证器均未能实现一致的扩展,这表明当前世界模型形成了一个信息瓶颈,想象的视角无法丰富细粒度推理。这些发现共同描绘了基于世界模型的推理中测试时验证的坏、好与丑的方面。我们的代码可在 https://github.com/chandar-lab/visa-for-mindjourney 获取。

关键词

引用

@article{arxiv.2512.05809,
  title  = {Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling},
  author = {Saurav Jha and M. Jehanzeb Mirza and Wei Lin and Shiqi Yang and Sarath Chandar},
  journal= {arXiv preprint arXiv:2512.05809},
  year   = {2025}
}

备注

Extended abstract at World Modeling Workshop 2026