中文

通过图像基础模型推进视频自监督学习

计算机视觉与模式识别 2025-05-27 v1

摘要

过去十年,图像基础模型 (IFM) 取得了显著进展。然而,直接利用 IFM 进行视频自监督表征学习的潜力尚未得到充分发掘。本研究提出一种推进视频自监督学习 (AdViSe) 的方法,旨在利用预训练 IFM 显著降低视频表征模型的训练开销。具体而言,我们首先在 IFM 中引入时序建模模块 (ResNet3D),构建视频表征模型。随后采用播放速率感知的视频自监督学习方法,在冻结 IFM 组件的同时训练时序模块。在 UCF101 数据集上实验表明,AdViSe 在性能上与最先进的方法相当,同时将训练时间缩短了 3.4×3.4\times,GPU 内存使用降低了 8.2×8.2\times。本研究为基于预训练 IFM 的低成本视频自监督学习提供了新的思路。代码已公开于 https://github.com/JingwWu/advise-video-ssl。

关键词

引用

@article{arxiv.2505.19218,
  title  = {Advancing Video Self-Supervised Learning via Image Foundation Models},
  author = {Jingwei Wu and Zhewei Huang and Chang Liu},
  journal= {arXiv preprint arXiv:2505.19218},
  year   = {2025}
}