中文

自监督视频预训练产生鲁棒且更贴合人类判断的视觉表示

计算机视觉与模式识别 2025-01-13 v3 人工智能 机器学习

摘要

人类通过观察物体与场景随时间的演变学习到强大的表示。然而,在那些不需要显式时间理解的特定任务之外,静态图像预训练仍是学习视觉基础模型的主导范式。我们质疑这一错位,并探究视频预训练能否产生具备人类感知特征的视觉表示:跨任务泛化、对扰动的鲁棒性,以及与人类判断的一致性。为此,我们提出一种新颖的视频筛选流程,并开发了一种从中复杂变换学习的对比框架。这一从视频中蒸馏知识的简单范式称为 VITO,所产生的通用表示在图像理解任务上远超先前的视频预训练方法,在视频理解任务上远超图像预训练方法。此外,VITO 表示对自然与合成形变的鲁棒性显著优于基于图像、视频及对抗训练得到的表示。最后,VITO 的预测与人类判断高度一致,超越了专门为此目的训练的模型。综上,这些结果表明视频预训练可能是学习统一、鲁棒且贴合人类的视觉世界表示的一种简单途径。

关键词

引用

@article{arxiv.2210.06433,
  title  = {Self-supervised video pretraining yields robust and more human-aligned visual representations},
  author = {Nikhil Parthasarathy and S. M. Ali Eslami and João Carreira and Olivier J. Hénaff},
  journal= {arXiv preprint arXiv:2210.06433},
  year   = {2025}
}

备注

Accepted to 37th Conference on Neural Information Processing Systems (NeurIPS 2023)