冻结的CLIP模型是高效的视频学习器
计算机视觉与模式识别
2022-08-09 v1
摘要
视频识别一直由端到端学习范式主导——首先用预训练图像模型的权重初始化视频识别模型,然后在视频上进行端到端训练。这使视频网络能够受益于预训练图像模型。然而,这需要在视频上微调的大量计算和内存资源,而不微调图像骨干、直接使用预训练图像特征的替代方案会导致次优结果。幸运的是,对比视觉-语言预训练(CLIP)的最新进展为视觉识别任务开辟了一条新路径。这些模型在大型开放词汇图像-文本对数据上预训练,学习到具有丰富语义的强大视觉表征。本文提出高效视频学习(EVL)——一个利用冻结CLIP特征直接训练高质量视频识别模型的高效框架。具体而言,我们采用轻量Transformer解码器并学习查询令牌,从CLIP图像编码器动态收集帧级空间特征。此外,我们在每个解码器层中采用局部时间模块,从相邻帧及其注意力图中发现时间线索。我们表明,尽管使用冻结骨干训练高效,我们的模型在多种视频识别数据集上学习到了高质量视频表征。代码见 https://github.com/OpenGVLab/efficient-video-recognition。
引用
@article{arxiv.2208.03550,
title = {Frozen CLIP Models are Efficient Video Learners},
author = {Ziyi Lin and Shijie Geng and Renrui Zhang and Peng Gao and Gerard de Melo and Xiaogang Wang and Jifeng Dai and Yu Qiao and Hongsheng Li},
journal= {arXiv preprint arXiv:2208.03550},
year = {2022}
}
备注
ECCV 2022