中文

无需像素感知:从相机轨迹进行感知

计算机视觉与模式识别 2026-04-03 v2

摘要

能否仅凭相机轨迹——它在空间中所划过的路径——来感知视频内容?本文首次系统性地调查了这一看似不切实际的问题。为此,我们提出了对比学习框架以训练 CamFormer——一种专为将相机姿态轨迹映射到联合嵌入空间并与自然语言对齐而设计的编码器。我们发现,尽管其表面简单,相机轨迹实际上蕴含着极其丰富的信息,可用于揭示视频内容。换言之,“你如何移动”确实能够提供关于“你正在做什么”(身体化视角)或“你正在观察”(外观化视角)的有价值的线索。我们在多样化的下游任务上展示了所学 CamFormer 嵌入的多样性,涵盖跨模态对齐、分类和时间分析等。重要的是,我们的表征在各种相机姿态估计方法中都具有鲁棒性,包括高保真多传感器方法和标准仅用 RGB 的估计器。我们的发现确立了相机轨迹作为一种轻量、稳健且通用的视频感知模态。

关键词

引用

@article{arxiv.2511.21681,
  title  = {Seeing without Pixels: Perception from Camera Trajectories},
  author = {Zihui Xue and Kristen Grauman and Dima Damen and Andrew Zisserman and Tengda Han},
  journal= {arXiv preprint arXiv:2511.21681},
  year   = {2026}
}

备注

Accepted by CVPR 2026, Project website: https://sites.google.com/view/seeing-without-pixels