看得更多,说得更多:轻量级语言专家是动态视频 Token 压缩器
计算机视觉与模式识别
2025-09-10 v2
摘要
大型视频语言模型的最新进展彻底改变了视频理解任务。然而,其效率因处理大量视觉 token 而受到显著限制。现有的 token 压缩策略采用固定的压缩率,忽略了不同视频片段间语义密度的可变性。因此,这导致信息丰富的片段因 token 不足而表示不充分,并在静态或内容贫乏的片段上产生不必要的计算。为了解决这一问题,我们提出了 LangDC,一种语言感知的动态 token 压缩器。LangDC 利用轻量级语言模型描述视频片段,将其转换为软字幕 token 作为视觉表示。在我们提出的语义密度感知监督下进行训练,LangDC 旨在 1) 涵盖下游任务推理所需的关键视觉线索,以及 2) 根据描述长度反映的场景丰富度动态调整压缩率。我们的设计模仿了人类动态表达所见事物的方式:复杂场景(看得更多)引发更详细的语言以传达细微差别(说得更多),而简单场景则用更少的词汇描述。实验结果表明,与 VideoGPT+ 相比,我们的方法在保持竞争力的同时减少了 49% 的 FLOPs。此外,定性结果证明我们的方法能根据视频片段的丰富度自适应调整 token 压缩率。
引用
@article{arxiv.2509.00969,
title = {Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors},
author = {Xiangchen Wang and Jinrui Zhang and Teng Wang and Haigang Zhang and Feng Zheng},
journal= {arXiv preprint arXiv:2509.00969},
year = {2025}
}
备注
17 pages, 8 figures, EMNLP2025