中文

扩展4D表示

计算机视觉与模式识别 2025-07-10 v2 人工智能 机器学习

摘要

对于纯粹基于自监督学习的视频,规模化尚未取得令人信服的效果。然而,先前的工作在语义相关任务上进行评估——例如动作分类、ImageNet分类等。在本文中,我们聚焦于在非语义视觉任务上进行自监督学习评估,这些任务更具空间性(3D)和时间性(+1D = 4D),例如相机姿态估计、点和目标跟踪、深度估计。我们展示,通过学习来自非常大的视频数据集,带掩码自编码(MAE)的transformer视频模型实际上是能够规模化的,随着模型大小从20M增长至目前报道的最大自监督视频模型——22B参数,在这些4D任务上 consistently improve performance。与许多最新图像和视频模型进行严格的全苹果对全橘子比较,展示了规模化4D表示的好处。预训练模型可在 https://github.com/google-deepmind/representations4d 获取。

关键词

引用

@article{arxiv.2412.15212,
  title  = {Scaling 4D Representations},
  author = {João Carreira and Dilara Gokay and Michael King and Chuhan Zhang and Ignacio Rocco and Aravindh Mahendran and Thomas Albert Keck and Joseph Heyward and Skanda Koppula and Etienne Pot and Goker Erdogan and Yana Hasson and Yi Yang and Klaus Greff and Guillaume Le Moing and Sjoerd van Steenkiste and Daniel Zoran and Drew A. Hudson and Pedro Vélez and Luisa Polanía and Luke Friedman and Chris Duvarney and Ross Goroshin and Kelsey Allen and Jacob Walker and Rishabh Kabra and Eric Aboussouan and Jennifer Sun and Thomas Kipf and Carl Doersch and Viorica Pătrăucean and Dima Damen and Pauline Luc and Mehdi S. M. Sajjadi and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2412.15212},
  year   = {2025}
}