中文

VideoGPT+:融合图像与视频编码器以增强视频理解

计算机视觉与模式识别 2024-06-14 v1

摘要

基于语言模型的进步,大型多模态模型(LMM)为视频理解带来了显著改进。虽然当前的视频LMM利用了先进的大型语言模型(LLM),但它们依赖图像或视频编码器来处理视觉输入,而每种编码器都有其局限性。图像编码器擅长从帧序列中捕捉丰富的空间细节,但缺乏显式的时间上下文,这在具有复杂动作序列的视频中可能很重要。另一方面,视频编码器提供了时间上下文,但通常受限于计算约束,导致只能以较低分辨率处理稀疏帧,从而降低了上下文和空间理解能力。为此,我们引入了VideoGPT+,它结合了图像编码器(用于详细的空间理解)和视频编码器(用于全局时间上下文建模)的互补优势。该模型通过将视频分割成更小的片段来处理视频,并对图像和视频编码器提取的特征应用自适应池化策略。我们的架构在多个视频基准测试中展示了改进的性能,包括VCGBench、MVBench和零样本问答。此外,我们使用一种新颖的半自动标注流程开发了112K视频指令集,进一步提升了模型性能。为了全面评估视频LMM,我们提出了VCGBench-Diverse,涵盖了18个广泛的视频类别,如生活方式、体育、科学、游戏和监控视频。该基准包含4,354个问答对,评估了现有LMM在密集视频描述、空间和时间理解以及复杂推理方面的泛化能力,确保了对不同视频类型和动态的全面评估。代码:https://github.com/mbzuai-oryx/VideoGPT-plus。

关键词

引用

@article{arxiv.2406.09418,
  title  = {VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding},
  author = {Muhammad Maaz and Hanoona Rasheed and Salman Khan and Fahad Khan},
  journal= {arXiv preprint arXiv:2406.09418},
  year   = {2024}
}

备注

Technical Report