中文

InternVideo2:扩展多模态视频理解的基础模型

计算机视觉与模式识别 2024-08-15 v4

摘要

我们引入了 InternVideo2,这是一个新的视频基础模型(ViFM)系列,在视频识别、视频-文本任务和以视频为中心的对话中取得了最先进的结果。我们的核心设计是一种渐进式训练方法,统一了掩码视频建模、跨模态对比学习和下一个 token 预测,将视频编码器规模扩展到 6B 参数。在数据层面,我们通过语义分割视频并生成视频-音频-语音字幕来优先考虑时空一致性。这改善了视频与文本之间的对齐。通过大量实验,我们验证了我们的设计,并在超过 60 个视频和音频任务上展示了卓越的性能。值得注意的是,我们的模型在各种视频相关对话和长视频理解基准测试中优于其他模型,突显了其推理和理解更长上下文的能力。代码和模型可在 https://github.com/OpenGVLab/InternVideo/tree/main/InternVideo2/ 获取。

关键词

引用

@article{arxiv.2403.15377,
  title  = {InternVideo2: Scaling Foundation Models for Multimodal Video Understanding},
  author = {Yi Wang and Kunchang Li and Xinhao Li and Jiashuo Yu and Yinan He and Chenting Wang and Guo Chen and Baoqi Pei and Ziang Yan and Rongkun Zheng and Jilan Xu and Zun Wang and Yansong Shi and Tianxiang Jiang and Songze Li and Hongjie Zhang and Yifei Huang and Yu Qiao and Yali Wang and Limin Wang},
  journal= {arXiv preprint arXiv:2403.15377},
  year   = {2024}
}

备注

a technical report about video understanding (accepted to ECCV2024)