基于预训练视觉与语言模型的多模态开放词汇视频分类
计算机视觉与模式识别
2022-07-18 v1 机器学习
摘要
利用在大规模图文对上预训练的视觉与语言模型(VLMs)正成为开放词汇视觉识别的一种有前景的范式。在本工作中,我们通过利用视频中天然存在的运动与音频来扩展这一范式。我们提出 MOV,一种用于多模态开放词汇视频分类的简单而有效的方法。在 MOV 中,我们直接使用预训练 VLMs 的视觉编码器,仅做最小修改来编码视频、光流和音频频谱图。我们设计了一种跨模态融合机制来聚合互补的多模态信息。在 Kinetics-700 和 VGGSound 上的实验表明,引入光流或音频模态相比预训练 VLM 及现有方法带来大幅性能提升。具体而言,MOV 大幅提高了基类上的准确率,同时在新类上泛化更好。MOV 在 UCF 和 HMDB 零样本视频分类基准上取得了最先进(state-of-the-art)结果,显著优于传统零样本方法和近期基于 VLMs 的方法。代码与模型将公开发布。
引用
@article{arxiv.2207.07646,
title = {Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models},
author = {Rui Qian and Yeqing Li and Zheng Xu and Ming-Hsuan Yang and Serge Belongie and Yin Cui},
journal= {arXiv preprint arXiv:2207.07646},
year = {2022}
}