中文

VideoLLaMA 2:提升视频-LLM 中的时空建模与音频理解

计算机视觉与模式识别 2024-10-31 v3 计算与语言

摘要

本文提出 VideoLLaMA 2,为增强视频和音频任务中时空建模与音频理解而设计的一组视频大语言模型(Video-LLM)。紧随其前作,VideoLLaMA 2 引入量身定制的时空卷积(STC)连接器,有效捕捉视频数据的复杂时空动力学。此外,我们通过联合训练将音频分支集成到模型中,从而通过无缝融合音频线索来丰富模型的多模态理解能力。针对多选视频问答(MC-VQA)、开放式视频问答(OE-VQA)和视频描述(VC)任务进行全面评估,结果显示 VideoLLaMA 2 在开源模型中始终保持竞争成绩,甚至在多个基准上接近一些专有模型。此外,VideoLLaMA 2 在音频-only 和音频-视频问答(AQA 与 OE-AVQA)基准上相较于现有模型表现出明显提升。这些进展凸显了 VideoLLaMA 2 在多模态理解方面的优越性能,为智能视频分析系统树立了新标准。所有模型均公开,以促进进一步研究。

关键词

引用

@article{arxiv.2406.07476,
  title  = {VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs},
  author = {Zesen Cheng and Sicong Leng and Hang Zhang and Yifei Xin and Xin Li and Guanzheng Chen and Yongxin Zhu and Wenqi Zhang and Ziyang Luo and Deli Zhao and Lidong Bing},
  journal= {arXiv preprint arXiv:2406.07476},
  year   = {2024}
}

备注

ZC, SL, HZ, YX, and XL contributed equally to this project. Code: https://github.com/DAMO-NLP-SG/VideoLLaMA2