中文

PooDLe:来自自然视频的池化与密集自监督学习

计算机视觉与模式识别 2025-04-24 v3 机器学习

摘要

自监督学习推动了从单主体、标志性图像学习方面的显著进展。然而,关于使用最小化策展的自然视频数据,仍存在未解答的问题,这些数据包含具有许多独立对象的密集场景、不平衡的类别分布以及变化的目标尺寸。在本文中,我们提出了 PooDLe,一种自监督学习方法,它结合了基于不变性的池化表示目标与强制光流扭曲等变性的密集 SSL 目标。我们的结果表明,在多个特征尺度上应用统一目标对于从自然视频中学习有效的图像表示至关重要。我们通过在 BDD100K 驾驶视频数据集和 Walking Tours 第一人称视频数据集上的实验验证了我们的方法,证明了其通过密集目标捕捉空间理解以及通过池化表示目标捕捉语义理解的能力。

关键词

引用

@article{arxiv.2408.11208,
  title  = {PooDLe: Pooled and dense self-supervised learning from naturalistic videos},
  author = {Alex N. Wang and Christopher Hoang and Yuwen Xiong and Yann LeCun and Mengye Ren},
  journal= {arXiv preprint arXiv:2408.11208},
  year   = {2025}
}

备注

Project page: https://agenticlearning.ai/poodle/