微调后的 CLIP 模型是高效的视频学习器
计算机视觉与模式识别
2023-03-28 v3 人工智能
摘要
基于图像-文本对的大规模多模态训练赋予了 CLIP 模型强大的泛化能力。由于在类似规模上训练视频数据不可行,近期方法集中于将基于图像的 CLIP 有效迁移至视频领域。为此,需新增参数化模块以学习时间信息及帧间关系,这要求精细的设计工作。此外,当所得模型在视频上学习时,往往会对给定任务分布过拟合且缺乏泛化能力。这引出了以下问题:如何有效地将图像级 CLIP 表征迁移至视频?本工作中,我们表明一个简单的视频微调 CLIP(ViFi-CLIP)基线通常足以弥合从图像到视频的域差距。我们的定性分析说明,CLIP 图像编码器随后的帧级处理,继以特征池化及与相应文本嵌入的相似度匹配,有助于在 ViFi-CLIP 内隐式建模时间线索。此类微调帮助模型聚焦于场景动态、运动物体及物体间关系。对于无法进行全面微调的低数据场景,我们提出一种“桥接与提示(bridge and prompt)”方法,先利用微调弥合域差距,再在语言和视觉侧学习提示以适配 CLIP 表征。我们在五个视频基准上的零样本、基类到新类泛化、少样本及全监督设定下广泛评估了这一简单而强大的基线。我们的代码见 https://github.com/muzairkhattak/VFi-CLIP。
引用
@article{arxiv.2212.03640,
title = {Fine-tuned CLIP Models are Efficient Video Learners},
author = {Hanoona Rasheed and Muhammad Uzair Khattak and Muhammad Maaz and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2212.03640},
year = {2023}
}
备注
Accepted at CVPR 2023