中文

Cambrian-P:基于摄影机姿态的视频理解

计算机视觉与模式识别 2026-05-22 v1

摘要

摄影机姿态 matters。每个视点的位置和方向定义一个共享的空间坐标系,将观察跨越视频帧关联起来。然而,这一信号在大多数用于视频理解的多模态LLM(MLLM)中几乎缺失,这些模型将帧处理为孤立的2D快照,而非人类感知的持久场景。我们重新审视姿态作为一种轻量级监督信号,提出Cambrian-P,一个augmented with per-frame learnable camera tokens and a pose regression head的视频MLLM。通过精心设计的抽样方案,该模型在空间推理基准如VSI-Bench上实现4.5-6.5%的显著提升,跨越八个额外的空间和一般视频 QA基准进行泛化,同时作为副产品,实现了ScanNet上 state of the art 流式姿态估计。意外的是,训练在伪标注姿态的野生视频上进一步提升了一般视频 QA基准,表明姿态有助于超越空间推理。综上,这些结果将摄影机姿态定位为推理关于物理世界的视频模型的基本信号。

关键词

引用

@article{arxiv.2605.22819,
  title  = {Cambrian-P: Pose-Grounded Video Understanding},
  author = {Jihan Yang and Zifan Zhao and Xichen Pan and Shusheng Yang and Junyi Zhang and Bingyi Kang and Hu Xu and Saining Xie},
  journal= {arXiv preprint arXiv:2605.22819},
  year   = {2026}
}

备注

Project Page: https://cambrian-mllm.github.io/