基于预训练视觉-语言模型的视频识别双向跨模态知识探索
计算机视觉与模式识别
2023-03-28 v2
摘要
在大规模图文对上预训练的视觉-语言模型(VLMs)已在多种视觉任务上展现出令人印象深刻的迁移能力。从此类强大的 VLMs 中迁移知识是构建高效视频识别模型的一个有前景的方向。然而,当前该领域的探索仍有限。我们认为预训练 VLMs 的最大价值在于搭建视觉与文本域之间的桥梁。本文提出一种称为 BIKE 的新框架,利用跨模态桥梁探索双向知识:i) 引入视频属性关联机制,借助视频到文本知识生成文本辅助属性以补充视频识别。ii) 提出时间概念定位机制,利用文本到视频专长以无参数方式捕获时间显著性,从而增强视频表征。在包括 Kinetics-400 与 600、UCF-101、HMDB-51、ActivityNet 和 Charades 在内的六个流行视频数据集上的大量研究表明,我们的方法在通用、零样本与少样本视频识别等多种识别场景下均达到最先进性能。使用发布的 CLIP 模型,我们的最佳模型在具挑战性的 Kinetics-400 上取得了 88.6% 的最先进准确率。代码见 https://github.com/whwu95/BIKE 。
引用
@article{arxiv.2301.00182,
title = {Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models},
author = {Wenhao Wu and Xiaohan Wang and Haipeng Luo and Jingdong Wang and Yi Yang and Wanli Ouyang},
journal= {arXiv preprint arXiv:2301.00182},
year = {2023}
}
备注
Accepted by CVPR 2023