中文

构建具有更优架构、优化与数据的开放词汇视频CLIP模型

计算机视觉与模式识别 2023-10-10 v1

摘要

尽管对比语言-图像预训练(CLIP)在零样本图像识别中取得了显著成果,但探索其用于零样本视频识别潜力的努力仍很有限。本文提出Open-VCLIP++,一个简单而有效的框架,将CLIP适配为强大的零样本视频分类器,能够在测试时识别新颖动作与事件。Open-VCLIP++对CLIP做最小修改以捕捉视频中的时空关系,从而创建一个专门的视频分类器同时力求泛化。我们形式化证明训练Open-VCLIP++等同于无历史数据的持续学习。为解决该问题,我们引入插值权重优化,一种在训练与测试阶段均利用权重插值优势的技术。此外,我们基于大语言模型生成细粒度视频描述。这些详细描述进一步与视频特征对齐,促进CLIP向视频领域的更好迁移。我们的方法在三个广泛使用的动作识别数据集上按多种零样本评估协议进行了评估。结果表明我们的方法以显著优势超越现有最先进(state-of-the-art)技术。具体而言,我们在UCF、HMDB与Kinetics-600数据集上分别取得88.1%、58.7%与81.2%的零样本准确率,超越性能最佳替代方法8.5%、8.2%与12.3%。我们还在MSR-VTT视频-文本检索数据集上评估了我们的方法,其取得了具竞争力的视频到文本与文本到视频检索性能,同时所用微调数据远少于其他方法。代码发布于https://github.com/wengzejia1/Open-VCLIP。

关键词

引用

@article{arxiv.2310.05010,
  title  = {Building an Open-Vocabulary Video CLIP Model with Better Architectures, Optimization and Data},
  author = {Zuxuan Wu and Zejia Weng and Wujian Peng and Xitong Yang and Ang Li and Larry S. Davis and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2310.05010},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2302.00624