InternVideo2.5:强化视频多模态大语言模型的长时序与丰富语境建模
计算机视觉与模式识别
2025-07-15 v3
摘要
本文旨在通过长时序与丰富语境(LRC)建模提高视频多模态大语言模型(MLLM)的性能。为此,我们开发了新的InternVideo2.5版本,重点增强原始MLLM捕捉细粒度细节和捕获视频中长时序结构的能力。具体而言,我们的方法通过直接偏好优化将密集视觉任务标注纳入MLLM,并通过自适应层次化 token 压缩开发紧凑的时空表示。实验结果表明,LRC的独特设计显著提高了视频MLLM在主流视频理解基准(短时序与长时序)上的表现,使其能够记忆至少原版6倍更长的视频输入,并掌握对象跟踪和分割等专门视觉能力。我们的工作凸显了多模态语境丰富性(长度与细节)在激发MLLM内在能力(聚焦与记忆)方面的重要性,为未来的视频MLLM研究提供了新视角。代码和模型均可在 https://github.com/OpenGVLab/InternVideo/tree/main/InternVideo2.5 获取。
引用
@article{arxiv.2501.12386,
title = {InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling},
author = {Yi Wang and Xinhao Li and Ziang Yan and Yinan He and Jiashuo Yu and Xiangyu Zeng and Chenting Wang and Changlian Ma and Haian Huang and Jianfei Gao and Min Dou and Kai Chen and Wenhai Wang and Yu Qiao and Yali Wang and Limin Wang},
journal= {arXiv preprint arXiv:2501.12386},
year = {2025}
}
备注
technical report