无需空间超感知地解决空间超感知问题
摘要
Cambrian-S 旨在通过引入(i)两个基准 VSI-Super-Recall (VSR) 和 VSI-Super-Counting (VSC),以及(ii)针对每个基准量身定制的预测感知推理策略,为改进视频世界模型的空间超感知提供第一步。本文对 Cambrian-S 在上述两个方面进行批判性分析。首先,我们提出一种简单基线 NoSense,摈弃绝大多数时间结构,仅使用基于 bag-of-words 的 SigLIP 模型,却在 VSR 上几乎完美地解决了问题,准确率达 95%,即便是在 4 小时视频上亦如此。这表明,类似 VSR 之类的基准可以在没有空间认知、世界建模或空间超感知的情况下几乎被解决。其次,我们假设 Cambrian-S 提出的量身定制推理方法可能利用基准中的捷径 heuristics。我们以 VSC 基准的简单 sanity check(称为 VSC-Repeat)进行说明:我们将每个视频与自身拼接 1-5 倍,而这不会改变唯一物体的数量。然而,这一简单扰动会使 Cambrian-S 的平均相对准确率从 42% 彻底降至 0%。进行空间超感知并整合跨经验信息的系统应能够识别同一场景的不同视角并保持物体计数预测不变;相反,Cambrian-S 的推理算法实际上大量依赖 VSC 基准中“房间从不被重复访问”这一捷径。综上所述,我们的发现表明:(i)当前的 VSI-Super 基准尚未可靠地衡量空间超感知;(ii)Cambrian-S 所使用的预测感知推理配方之所以提升性能,实际上是无意中利用了捷径,而非来自稳健的空间超感知。我们附上 Cambrian-S 作者的回应(见附录 A),以提供平衡的视角。我们在 GitHub 上发布代码:https://github.com/bethgelab/supersanity
关键词
引用
@article{arxiv.2511.16655,
title = {Solving Spatial Supersensing Without Spatial Supersensing},
author = {Vishaal Udandarao and Shyamgopal Karthik and Surabhi S. Nath and Andreas Hochlehnert and Matthias Bethge and Ameya Prabhu},
journal= {arXiv preprint arXiv:2511.16655},
year = {2025}
}
备注
Tech Report