中文

Clapper:视觉语言模型中紧凑的学习与视频表示

计算机视觉与模式识别 2025-05-22 v1

摘要

当前的视觉语言模型(VLMs)在 diverse video understanding applications 中展现出惊人的能力。设计针对视频输入的 VLMs 需要有效地建模时间维度(即捕捉跨帧的依赖关系),同时平衡短视频和长视频的处理。具体而言,短视频需要保留细粒度细节,而长视频则需要对视觉信息进行策略性压缩,以高效处理广泛的时序上下文。然而,我们的经验分析揭示了一个关键局限性:大多数现有 VLMs 在将视觉 token 压缩至原始视觉 token 的四分之一以下时,严重损失长视频理解任务的性能。为更有效地建模短视频和长视频输入,我们提出了Clapper方法,采用慢-快策略进行视频表示,并引入名为TimePerceiver的新型模块,用于在现有 VLM 框架中实现高效的时间-空间编码。通过我们的方法,我们实现了每帧 13 倍的视觉 token 压缩(平均每帧 61 个 token),而不牺牲问答准确性。在我们的实验中,Clapper 在VideoMME 上达到 62.0%,在MLVU 上达到 69.8%,在TempCompass 上达到 67.4%,所有视频的视觉 token 总数均不足 6000 个。代码将在主页公开。

关键词

引用

@article{arxiv.2505.15529,
  title  = {Clapper: Compact Learning and Video Representation in VLMs},
  author = {Lingyu Kong and Hongzhi Zhang and Jingyuan Zhang and Jianzhao Huang and Kunze Li and Qi Wang and Fuzheng Zhang},
  journal= {arXiv preprint arXiv:2505.15529},
  year   = {2025}
}