ARVideo:自回归预训练用于自监督视频表征学习
计算机视觉与模式识别
2024-05-27 v1
摘要
本文提出了一种新的自监督视频表征学习框架 ARVideo,通过自回归方式预测特定序列顺序中的下一个视频标记。本文包含两个关键设计:第一,我们将视频标记组织成跨空间和时间的聚类,从而实现比标准空间唯一聚类或时间唯一聚类更丰富的上下文信息聚合。第二,我们采用随机的时空预测顺序以促进学习多维数据,解决手工设计的空间优先或时间优先序列顺序的局限性。大量实验表明,ARVideo 是自监督视频表征学习的有效范式。例如,当使用 ViT-B backbone 训练时,ARVideo 在 Kinetics-400 上获得 81.2%的准确率,在 Something-Something V2 上获得 70.9%的准确率,与 VideoMAE 的强大基准相当。重要的是,ARVideo 还表现出更高的训练效率,即相比 VideoMAE 训练速度快 14%,所需 GPU 内存减少 58%。
引用
@article{arxiv.2405.15160,
title = {ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning},
author = {Sucheng Ren and Hongru Zhu and Chen Wei and Yijiang Li and Alan Yuille and Cihang Xie},
journal= {arXiv preprint arXiv:2405.15160},
year = {2024}
}