中文

一种用于高效视频理解的 LMM 通过视频立方体的强化压缩

计算机视觉与模式识别 2025-04-22 v1 计算与语言

摘要

大型多模态模型 (LMM) 统一地感知视频帧,导致对内在时间密度变化的视频存在计算效率低下。本文提出了 **Quicksviewer**,一种新的感知范式的 LMM,通过 Gumbel Softmax 将时间密度非均匀的视频划分为不同大小的立方体,然后对每个立方体进行统一的重采样,以实现高效的视频理解。这种简单直观的方法能够根据视频的时间密度动态地在线压缩视频,显著减少时空冗余(整体压缩率达45倍),同时能够利用大感受野进行高效训练。我们通过三个渐进阶段从语言基础模型训练而来,每个阶段平均利用420秒/1fps的长视频, thanks to the perceiving efficiency。仅使用0.8百万总视频文本样本进行训练,我们的模型相比采用固定划分策略的直接基线在准确率上提高了最高8.72,展示了其性能有效性。在Video-MME上,Quicksviewer仅需每帧最高5%的token数即可达到基线的SOTA。该范式下,扩大输入帧数会清晰地揭示模型能力的幂律规律。实证验证表明,立方网络生成的片段有助于分析视频中的连续事件。

关键词

引用

@article{arxiv.2504.15270,
  title  = {An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes},
  author = {Ji Qi and Yuan Yao and Yushi Bai and Bin Xu and Juanzi Li and Zhiyuan Liu and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2504.15270},
  year   = {2025}
}