中文

DynTok:面向高效视频理解的视觉令牌动态压缩

计算与语言 2025-06-05 v1 计算机视觉与模式识别

摘要

典型的视频建模方法,如LLava,将视频表示为视觉令牌序列,然后由LLM主干处理以实现有效的视频理解。然而,这种方法会导致大量的视觉令牌,尤其是对于长视频。一个实用的解决方案是在将大型视觉上下文馈送到LLM主干之前,先从中提取相关的视觉信息,从而减少计算开销。在这项工作中,我们引入了DynTok,一种新颖的**动态**视频**令牌**压缩策略。DynTok自适应地将视觉令牌分组并在每组内合并,在信息密度低的区域实现高压缩,同时保留关键内容。我们的方法将令牌数量减少到原始规模的44.4%,同时保持相当的性能。它进一步受益于增加视频帧数,在Video-MME上达到65.3%,在MLVU上达到72.5%。通过应用这种简单而有效的压缩方法,我们揭示了视频令牌表示中的冗余性,并为设计更高效的视频建模技术提供了见解。

关键词

引用

@article{arxiv.2506.03990,
  title  = {DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding},
  author = {Hongzhi Zhang and Jingyuan Zhang and Xingguang Ji and Qi Wang and Fuzheng Zhang},
  journal= {arXiv preprint arXiv:2506.03990},
  year   = {2025}
}