中文

何时以及想象多少:基于世界模型的自适应测试时缩放用于视觉空间推理

计算机视觉与模式识别 2026-02-10 v1 人工智能 计算与语言

摘要

尽管多模态大语言模型(MLLM)取得了快速进展,但当正确答案取决于场景在未见或替代视角下的外观时,视觉空间推理仍然不可靠。最近的工作通过结合世界模型进行视觉想象来增强推理,但诸如想象何时真正必要、多少想象有益、以及何时想象有害等问题仍知之甚少。在实践中,不加区分的想象可能会增加计算量,甚至因引入误导性证据而降低性能。在这项工作中,我们对作为空间推理可控资源的测试时视觉想象进行了深入分析。我们研究了何时静态视觉证据足够,何时想象能改善推理,以及过度或不必要的想象如何影响准确性和效率。为支持此分析,我们提出了AVIC,一个基于世界模型的自适应测试时框架,该框架在选择性调用和缩放视觉想象之前,明确推理当前视觉证据的充分性。在空间推理基准(SAT, MMSI)和具身导航基准(R2R)上,我们的结果揭示了想象至关重要、边际或有害的清晰场景,并表明选择性控制可以在大幅减少世界模型调用和语言标记的情况下,匹配或超越固定想象策略。总的来说,我们的发现强调了分析和控制测试时想象对于高效可靠的空间推理的重要性。

关键词

引用

@article{arxiv.2602.08236,
  title  = {When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning},
  author = {Shoubin Yu and Yue Zhang and Zun Wang and Jaehong Yoon and Huaxiu Yao and Mingyu Ding and Mohit Bansal},
  journal= {arXiv preprint arXiv:2602.08236},
  year   = {2026}
}

备注

the first two authors are equally contributed. Project page: https://adaptive-visual-tts.github.io/