Open-VCLIP:通过插值权重优化将 CLIP 转化为开放词汇视频模型
计算机视觉与模式识别
2023-06-01 v3
摘要
对比语言-图像预训练 (CLIP) 已展现出令人印象深刻的零样本图像理解能力,但将其用于零样本视频识别的研究仍十分有限。我们提出 Open-VCLIP,一种简单而有效的方法,将 CLIP 转化为一个强大的零样本视频分类器,可在测试时识别未见过的动作与事件。我们的框架以最小修改扩展 CLIP 以建模视频中的时空关系,使其成为专用的视频分类器,同时力求泛化性。我们形式化地表明,训练 Open-VCLIP 等价于无历史数据的持续学习。为解决该问题,我们提出插值权重优化,在训练与测试时均利用权重插值的优势。我们在三个流行且具挑战性的动作识别数据集上依据多种零样本评估协议进行评测,结果表明我们的方法以明显优势超越最先进方法。具体而言,我们在 UCF、HMDB 与 Kinetics-600 上分别取得 87.9%、58.3%、81.1% 的零样本准确率,比最先进方法分别高出 8.3%、7.8% 与 12.2%。代码发布于 https://github.com/wengzejia1/Open-VCLIP。
引用
@article{arxiv.2302.00624,
title = {Open-VCLIP: Transforming CLIP to an Open-vocabulary Video Model via Interpolated Weight Optimization},
author = {Zejia Weng and Xitong Yang and Ang Li and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2302.00624},
year = {2023}
}
备注
12 pages, 4 figures, ICML 2023