通过图像基础模型推进视频自监督学习
计算机视觉与模式识别
2025-05-27 v1
摘要
过去十年,图像基础模型 (IFM) 取得了显著进展。然而,直接利用 IFM 进行视频自监督表征学习的潜力尚未得到充分发掘。本研究提出一种推进视频自监督学习 (AdViSe) 的方法,旨在利用预训练 IFM 显著降低视频表征模型的训练开销。具体而言,我们首先在 IFM 中引入时序建模模块 (ResNet3D),构建视频表征模型。随后采用播放速率感知的视频自监督学习方法,在冻结 IFM 组件的同时训练时序模块。在 UCF101 数据集上实验表明,AdViSe 在性能上与最先进的方法相当,同时将训练时间缩短了 ,GPU 内存使用降低了 。本研究为基于预训练 IFM 的低成本视频自监督学习提供了新的思路。代码已公开于 https://github.com/JingwWu/advise-video-ssl。
引用
@article{arxiv.2505.19218,
title = {Advancing Video Self-Supervised Learning via Image Foundation Models},
author = {Jingwei Wu and Zhewei Huang and Chang Liu},
journal= {arXiv preprint arXiv:2505.19218},
year = {2025}
}