中文

看得更多,说得更多:轻量级语言专家是动态视频 Token 压缩器

计算机视觉与模式识别 2025-09-10 v2

摘要

大型视频语言模型的最新进展彻底改变了视频理解任务。然而,其效率因处理大量视觉 token 而受到显著限制。现有的 token 压缩策略采用固定的压缩率,忽略了不同视频片段间语义密度的可变性。因此,这导致信息丰富的片段因 token 不足而表示不充分,并在静态或内容贫乏的片段上产生不必要的计算。为了解决这一问题,我们提出了 LangDC,一种语言感知的动态 token 压缩器。LangDC 利用轻量级语言模型描述视频片段,将其转换为软字幕 token 作为视觉表示。在我们提出的语义密度感知监督下进行训练,LangDC 旨在 1) 涵盖下游任务推理所需的关键视觉线索,以及 2) 根据描述长度反映的场景丰富度动态调整压缩率。我们的设计模仿了人类动态表达所见事物的方式:复杂场景(看得更多)引发更详细的语言以传达细微差别(说得更多),而简单场景则用更少的词汇描述。实验结果表明,与 VideoGPT+ 相比,我们的方法在保持竞争力的同时减少了 49% 的 FLOPs。此外,定性结果证明我们的方法能根据视频片段的丰富度自适应调整 token 压缩率。

关键词

引用

@article{arxiv.2509.00969,
  title  = {Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors},
  author = {Xiangchen Wang and Jinrui Zhang and Teng Wang and Haigang Zhang and Feng Zheng},
  journal= {arXiv preprint arXiv:2509.00969},
  year   = {2025}
}

备注

17 pages, 8 figures, EMNLP2025