中文

InternVideo:基于生成式与判别式学习的通用视频基础模型

计算机视觉与模式识别 2022-12-08 v2

摘要

基础模型近期在计算机视觉的多种下游任务中展现出卓越性能。然而,现有大多数视觉基础模型仅关注图像级预训练与适配,难以应对动态且复杂的视频级理解任务。为弥补这一不足,我们提出通用视频基础模型 InternVideo,充分利用生成式与判别式自监督视频学习。具体而言,InternVideo 高效地将掩码视频建模与视频-语言对比学习作为预训练目标,并以可学习的方式选择性地协调这两种互补框架的视频表征,以提升各类视频应用。无需额外技巧,InternVideo 在涵盖视频动作识别/检测、视频-语言对齐及开放世界视频应用等广泛任务的 39 个视频数据集上取得了最先进的性能。尤其值得注意的是,我们的方法在具有挑战性的 Kinetics-400 和 Something-Something V2 基准上分别获得了 91.1% 和 77.2% 的 top-1 准确率。所有这些结果有效地展示了我们的 InternVideo 在视频理解方面的通用性。代码将发布于 https://github.com/OpenGVLab/InternVideo。

关键词

引用

@article{arxiv.2212.03191,
  title  = {InternVideo: General Video Foundation Models via Generative and Discriminative Learning},
  author = {Yi Wang and Kunchang Li and Yizhuo Li and Yinan He and Bingkun Huang and Zhiyu Zhao and Hongjie Zhang and Jilan Xu and Yi Liu and Zun Wang and Sen Xing and Guo Chen and Junting Pan and Jiashuo Yu and Yali Wang and Limin Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2212.03191},
  year   = {2022}
}

备注

technical report