自监督视频预训练产生鲁棒且更贴合人类判断的视觉表示
计算机视觉与模式识别
2025-01-13 v3 人工智能
机器学习
摘要
人类通过观察物体与场景随时间的演变学习到强大的表示。然而,在那些不需要显式时间理解的特定任务之外,静态图像预训练仍是学习视觉基础模型的主导范式。我们质疑这一错位,并探究视频预训练能否产生具备人类感知特征的视觉表示:跨任务泛化、对扰动的鲁棒性,以及与人类判断的一致性。为此,我们提出一种新颖的视频筛选流程,并开发了一种从中复杂变换学习的对比框架。这一从视频中蒸馏知识的简单范式称为 VITO,所产生的通用表示在图像理解任务上远超先前的视频预训练方法,在视频理解任务上远超图像预训练方法。此外,VITO 表示对自然与合成形变的鲁棒性显著优于基于图像、视频及对抗训练得到的表示。最后,VITO 的预测与人类判断高度一致,超越了专门为此目的训练的模型。综上,这些结果表明视频预训练可能是学习统一、鲁棒且贴合人类的视觉世界表示的一种简单途径。
引用
@article{arxiv.2210.06433,
title = {Self-supervised video pretraining yields robust and more human-aligned visual representations},
author = {Nikhil Parthasarathy and S. M. Ali Eslami and João Carreira and Olivier J. Hénaff},
journal= {arXiv preprint arXiv:2210.06433},
year = {2025}
}
备注
Accepted to 37th Conference on Neural Information Processing Systems (NeurIPS 2023)