中文

VideoLLaMA 3:面向图像和视频理解的前沿多模态基础模型

计算机视觉与模式识别 2025-06-04 v4

摘要

本文提出 VideoLLaMA3,一个用于图像和视频理解的更高级的多模态基础模型。VideoLLaMA3 的核心设计理念是 vision-centric(面向视觉的)。所谓 vision-centric,有两层含义:视觉中心的训练范式和视觉中心的框架设计。我们视觉中心训练范式的关键洞察是,高质量的图像-文本数据对图像和视频理解都至关重要。我们专注于构建大规模高质量的图像-文本数据集,而非准备大量的视频-文本数据集。VideoLLaMA3 包含四个训练阶段:1)视觉编码器适配,使视觉编码器能够接受不同分辨率的图像作为输入;2)视觉-语言对齐,通过覆盖多种类型(包括场景图像、文档、图表)以及仅含文本的数据大规模图像-文本数据对视觉编码器、投影层和大语言模型进行联合调优;3)多任务微调,融入用于下游任务的图像-文本 SFT 数据和视频-文本数据,为视频理解奠定基础;4)视频中心微调,进一步提升模型在视频理解方面的能力。就框架设计而言,为更好地捕获图像中的细粒度细节,预训练的视觉编码器被适配为将不同大小的图像编码为具有相应数量视觉 token 的表示,而非固定数量的 token。对于视频输入,我们根据它们的相似度减少视觉 token 的数量,以便更精确、更紧凑地表示视频。凭借视觉中心的设计,VideoLLaMA3 在图像和视频理解基准测试中实现了卓越的性能。

关键词

引用

@article{arxiv.2501.13106,
  title  = {VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding},
  author = {Boqiang Zhang and Kehan Li and Zesen Cheng and Zhiqiang Hu and Yuqian Yuan and Guanzheng Chen and Sicong Leng and Yuming Jiang and Hang Zhang and Xin Li and Peng Jin and Wenqi Zhang and Fan Wang and Lidong Bing and Deli Zhao},
  journal= {arXiv preprint arXiv:2501.13106},
  year   = {2025}
}

备注

BZ, KL, ZC, ZH, YY, GC, SL, YJ, HZ, and XL contributed equally to this project. Code: https://github.com/DAMO-NLP-SG/VideoLLaMA3