Cambrian-S:面向空间超感知的视频
计算机视觉与模式识别
2025-11-07 v1
摘要
我们认为,真正的多模态智能需要从反应式、任务驱动的系统和蛮力长上下文,转向更广泛的超感知范式。我们将空间超感知定义为四个阶段:语义感知(命名看到的东西)、流式事件认知(在持续经验中保持记忆)、隐式 3D 空间认知(推断像素背后的世界)以及预测世界建模(创建内部模型以过滤和组织信息)。当前基准主要测试前两个阶段,覆盖范围有限,很少对需要真正世界建模的情境提出挑战。为推动空间超感知的进展,我们提出 VSI-SUPER,一个包含两个子任务的基准:VSR(长期视觉空间回忆)和 VSC(持续视觉空间计数)。这些任务需要处理任意长度的视频输入,却抵御了蛮力上下文扩展。我们通过 curating VSI-590K 并训练 Cambrian-S,实现了在 VSI-Bench 上不 sacrificing general capabilities 的情况下获得30%的绝对提升。然而,VSI-SUPER 的性能仍有限,表明规模本身不足以实现空间超感知。我们提出预测感知作为前进路径,展示了一个概念验证:自监督的下一个潜在帧预测器利用惊讶(预测误差)驱动记忆和事件分段。在 VSI-SUPER 上,该方法显著超过了领先的专有基线,表明空间超感知需要模型不仅能看到,还能预期、选择和组织经验。
引用
@article{arxiv.2511.04670,
title = {Cambrian-S: Towards Spatial Supersensing in Video},
author = {Shusheng Yang and Jihan Yang and Pinzhi Huang and Ellis Brown and Zihao Yang and Yue Yu and Shengbang Tong and Zihan Zheng and Yifan Xu and Muhan Wang and Daohan Lu and Rob Fergus and Yann LeCun and Li Fei-Fei and Saining Xie},
journal= {arXiv preprint arXiv:2511.04670},
year = {2025}
}
备注
Website: https://cambrian-mllm.github.io/