中文

VideoChat-Flash:用于长上下文视频建模的层次化压缩

计算机视觉与模式识别 2025-07-15 v4 机器学习

摘要

长上下文视频建模对于多模态大语言模型(MLLM)至关重要,使其能够处理电影、在线视频流等。尽管取得了进展,但由于难以高效理解极长的视频上下文,处理长视频仍然具有挑战性。本文旨在从模型架构、训练数据、训练策略和评估基准等方面解决这一问题。首先,我们提出了一种新颖的层次化视频令牌压缩(HiCo)方法,该方法利用长视频中的视觉冗余,将长视频上下文从片段级压缩到视频级,在保留必要细节的同时显著减少计算量,实现了约1/50的极端压缩比且几乎没有性能损失。其次,我们引入了一种多阶段短到长学习方案、一个名为LongVid的大规模真实世界长视频数据集,以及一个具有挑战性的“多跳大海捞针”基准。最后,我们构建了一个强大的视频MLLM,名为VideoChat-Flash,在2B和7B模型规模的主流长视频和短视频基准上均表现出领先性能。它在开源模型中首次在NIAH中实现了超过10,000帧的99.1%准确率。

关键词

引用

@article{arxiv.2501.00574,
  title  = {VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling},
  author = {Xinhao Li and Yi Wang and Jiashuo Yu and Xiangyu Zeng and Yuhan Zhu and Haian Huang and Jianfei Gao and Kunchang Li and Yinan He and Chenting Wang and Yu Qiao and Yali Wang and Limin Wang},
  journal= {arXiv preprint arXiv:2501.00574},
  year   = {2025}
}