中文

长第一人称视频中的空间条件推理

计算机视觉与模式识别 2026-04-09 v2

摘要

由于视角漂移和缺乏持久的几何上下文,长时程第一人称视频对视觉导航提出了重大挑战。尽管近期的视觉语言模型在图像和短视频推理上表现良好,但它们在长第一人称序列中的空间推理能力仍然有限。在这项工作中,我们研究了显式空间信号如何在不修改模型架构或推理过程的情况下影响基于VLM的视频理解。我们引入了Sanpo-D,即对Google Sanpo数据集的细粒度重新标注,并在面向导航的空间查询上对多个VLM进行了基准测试。为了检验输入级的归纳偏置,我们进一步将深度图与RGB帧融合,并评估其对空间推理的影响。我们的结果揭示了通用精度与空间特化之间的权衡,表明深度感知和空间扎根表示能够改善在安全关键任务(如行人和障碍物检测)上的性能。

关键词

引用

@article{arxiv.2601.18100,
  title  = {Spatial-Conditioned Reasoning in Long-Egocentric Videos},
  author = {James Tribble and Hao Wang and Si-En Hong and Chaoyi Zhou and Ashish Bastola and Siyu Huang and Abolfazl Razi},
  journal= {arXiv preprint arXiv:2601.18100},
  year   = {2026}
}