Apollo:大型多模态模型中视频理解的探索
计算机视觉与模式识别
2024-12-16 v1 人工智能
摘要
尽管视频感知能力已快速集成至大型多模态模型(LMM)中,但这些模型视频理解的底层机制仍鲜有人知。因此,该领域许多设计决策缺乏充分的依据或分析。训练与评估此类模型的高计算成本,加上研究开放性不足,阻碍了视频-LMM 的发展。为此,我们提出全面研究,以阐明视频理解在 LMM 中实际的驱动因素。我们首先批判性地审视了视频-LMM 研究的主要计算成本来源,发现规模一致性(Scaling Consistency)——即在较小模型与数据集(达到临界规模)上的设计与训练决策,能有效迁移至更大模型。基于这些洞见,我们探索了视频-LMM 的诸多视频专属方面,包括视频采样、架构、数据构成、训练计划等。例如,我们证明在训练中使用帧率采样(fps sampling)远优于均匀帧采样(uniform frame sampling),并确定了最适合视频表征的最佳视觉编码器。循着这些发现,我们引入 Apollo,一个在不同模型规模下表现卓越的 LMM 系列。我们的模型能高效感知时长为小时的视频,Apollo-3B 在 LongVideoBench 上取得 55.1 分,Apollo-7B 在 MLVU 上达到 70.9 分,在 Video-MME 上达到 63.3 分,均实现最新水平。
引用
@article{arxiv.2412.10360,
title = {Apollo: An Exploration of Video Understanding in Large Multimodal Models},
author = {Orr Zohar and Xiaohan Wang and Yann Dubois and Nikhil Mehta and Tong Xiao and Philippe Hansen-Estruch and Licheng Yu and Xiaofang Wang and Felix Juefei-Xu and Ning Zhang and Serena Yeung-Levy and Xide Xia},
journal= {arXiv preprint arXiv:2412.10360},
year = {2024}
}
备注
https://apollo-lmms.github.io