中文

离网移动:场景导向的视频表示

计算机视觉与模式识别 2024-11-12 v1 人工智能 机器学习

摘要

当前视觉模型通常在其表示结构与图像空间之间保持固定的对应关系。每一层由一组排列在“网格上”的 token 组成,这导致这些 patch 或 token 被偏向于在特定时空位置编码信息。在本工作中,我们提出了 Moving Off-the-Grid (MooG),一种自监督视频表示模型,提供了另一种方法,使 token 能够“离网”移动,以更好地在时间推移过程中持续代表场景元素。通过结合跨注意力和位置嵌入,我们解耦了表示结构与图像结构。我们发现,一个简单的自监督目标——下一帧预测——在视频数据上进行训练,结果得到的一组潜在 token 能够绑定到特定的场景结构,并随其移动进行跟踪。我们通过在学习到的表示上训练各种下游任务的 readouts,既定性地和定量地展示了 MooG 所学习表示的有用性。我们显示,MooG 能为不同的视觉任务提供强大的基础,与“网格上”的基线方法相比更具优势。

关键词

引用

@article{arxiv.2411.05927,
  title  = {Moving Off-the-Grid: Scene-Grounded Video Representations},
  author = {Sjoerd van Steenkiste and Daniel Zoran and Yi Yang and Yulia Rubanova and Rishabh Kabra and Carl Doersch and Dilara Gokay and Joseph Heyward and Etienne Pot and Klaus Greff and Drew A. Hudson and Thomas Albert Keck and Joao Carreira and Alexey Dosovitskiy and Mehdi S. M. Sajjadi and Thomas Kipf},
  journal= {arXiv preprint arXiv:2411.05927},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024 (spotlight). Project page: https://moog-paper.github.io/