Vita-CLIP:基于多模态提示的视频与文本自适应 CLIP
计算机视觉与模式识别
2023-04-10 v1 图像与视频处理
摘要
将 CLIP 等对比图像-文本预训练模型应用于视频分类,因其成本效益和颇具竞争力的性能而备受关注。然而,该领域的近期工作面临一种权衡。对预训练模型进行微调以获得强大的监督性能,会导致零样本泛化能力降低。类似地,冻结主干网络以保留零样本能力,会导致监督准确率显著下降。因此,文献中的近期工作通常为监督和零样本动作识别分别训练独立的模型。在本工作中,我们提出了一种多模态提示学习方案,旨在单次统一训练下平衡监督与零样本性能。我们在视觉端的提示方法涵盖三个方面:1)全局视频级提示,用于对数据分布进行建模;2)局部帧级提示,用于提供逐帧的判别性条件约束;3)摘要提示,用于提取紧凑的视频表示。此外,我们在文本端定义了一种提示方案以增强文本上下文。通过此提示方案,我们在 Kinetics-600、HMDB51 和 UCF101 上实现了最先进的零样本性能,同时在监督设置下保持竞争力。通过保持预训练主干网络冻结,我们优化了数量少得多的参数,并保留了现有的通用表示,这有助于实现强大的零样本性能。我们的代码/模型已发布于 https://github.com/TalalWasim/Vita-CLIP。
引用
@article{arxiv.2304.03307,
title = {Vita-CLIP: Video and text adaptive CLIP via Multimodal Prompting},
author = {Syed Talal Wasim and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan and Mubarak Shah},
journal= {arXiv preprint arXiv:2304.03307},
year = {2023}
}
备注
Accepted at CVPR-2023. Codes/models available at https://github.com/TalalWasim/Vita-CLIP