重新审视基于视频学习视觉表示的特征预测
计算机视觉与模式识别
2024-04-15 v1 人工智能
机器学习
摘要
本文探讨了将特征预测作为从视频中进行无监督学习的独立目标,并引入了 V-JEPA,这是一系列仅使用特征预测目标训练的视觉模型,不使用预训练的图像编码器、文本、负样本、重构或其他监督来源。这些模型在从公开数据集收集的 200 万个视频上进行训练,并在下游图像和视频任务上进行评估。我们的结果表明,通过预测视频特征进行学习可以产生通用的视觉表示,这些表示在基于运动和基于外观的任务上均表现良好,而无需调整模型参数;例如,使用冻结的骨干网络。我们最大的模型,一个仅在视频上训练的 ViT-H/16,在 Kinetics-400 上获得 81.9% 的准确率,在 Something-Something-v2 上获得 72.2%,在 ImageNet1K 上获得 77.9%。
引用
@article{arxiv.2404.08471,
title = {Revisiting Feature Prediction for Learning Visual Representations from Video},
author = {Adrien Bardes and Quentin Garrido and Jean Ponce and Xinlei Chen and Michael Rabbat and Yann LeCun and Mahmoud Assran and Nicolas Ballas},
journal= {arXiv preprint arXiv:2404.08471},
year = {2024}
}