中文

Apollo:大型多模态模型中视频理解的探索

计算机视觉与模式识别 2024-12-16 v1 人工智能

摘要

尽管视频感知能力已快速集成至大型多模态模型(LMM)中,但这些模型视频理解的底层机制仍鲜有人知。因此,该领域许多设计决策缺乏充分的依据或分析。训练与评估此类模型的高计算成本,加上研究开放性不足,阻碍了视频-LMM 的发展。为此,我们提出全面研究,以阐明视频理解在 LMM 中实际的驱动因素。我们首先批判性地审视了视频-LMM 研究的主要计算成本来源,发现规模一致性(Scaling Consistency)——即在较小模型与数据集(达到临界规模)上的设计与训练决策,能有效迁移至更大模型。基于这些洞见,我们探索了视频-LMM 的诸多视频专属方面,包括视频采样、架构、数据构成、训练计划等。例如,我们证明在训练中使用帧率采样(fps sampling)远优于均匀帧采样(uniform frame sampling),并确定了最适合视频表征的最佳视觉编码器。循着这些发现,我们引入 Apollo,一个在不同模型规模下表现卓越的 LMM 系列。我们的模型能高效感知时长为小时的视频,Apollo-3B 在 LongVideoBench 上取得 55.1 分,Apollo-7B 在 MLVU 上达到 70.9 分,在 Video-MME 上达到 63.3 分,均实现最新水平。

关键词

引用

@article{arxiv.2412.10360,
  title  = {Apollo: An Exploration of Video Understanding in Large Multimodal Models},
  author = {Orr Zohar and Xiaohan Wang and Yann Dubois and Nikhil Mehta and Tong Xiao and Philippe Hansen-Estruch and Licheng Yu and Xiaofang Wang and Felix Juefei-Xu and Ning Zhang and Serena Yeung-Levy and Xide Xia},
  journal= {arXiv preprint arXiv:2412.10360},
  year   = {2024}
}

备注

https://apollo-lmms.github.io