中文

DyCoke: 用于快速视频大语言模型的动态 token 压缩

计算机视觉与模式识别 2025-03-31 v3 机器学习

摘要

视频大语言模型 (VLLM) 最近在处理复杂视频内容方面取得了显著进展,但其推理效率仍受限于来自视频输入产生的大量视觉 token 的高计算成本。我们经验性地发现,与单张图像输入不同,VLLM 在不同解码迭代中通常关注来自不同帧的视觉 token,采用一次性剪枝策略容易误删重要 token。基于此,我们提出 DyCoke,一种用于优化 token 表示并加速 VLLM 的无训练 token 压缩方法。DyCoke 集成一个即插即用的时间压缩模块,通过合并跨帧中冗余的 token 来最小化时间冗余,并应用动态 KV 缓存压缩对空间上冗余的 token 进行选择性剪枝。它确保在每个解码步骤中动态保留关键 token,以保证高质量推理。大量实验结果表明,DyCoke 能超过先前的 SoTA 框架,在不进行训练的情况下实现 1.5 倍推理加速、1.4 倍内存降低,同时提升性能。

关键词

引用

@article{arxiv.2411.15024,
  title  = {DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models},
  author = {Keda Tao and Can Qin and Haoxuan You and Yang Sui and Huan Wang},
  journal= {arXiv preprint arXiv:2411.15024},
  year   = {2025}
}

备注

13 pages, 7 figures