中文

高效视频采样:加快 VLM 推理速度的记忆体削减技术

计算机视觉与模式识别 2025-10-17 v1

摘要

视觉语言模型 (VLM) 最近从静态图像理解扩展到视频推理,但其可扩展性受限于稠密帧序列处理的二次计算成本。长视频常常超出现代语言模型的 token 预算,导致严重的上下文限制和延迟问题。我们引入高效视频采样 (EVS),一种简单且即插即用的方法,通过识别并削减连续帧中保持不变的空间区域(即时间上静止的 patch)来减少视频中的 token 冗余。EVS 保留位置标识,无需架构更改或重新训练。我们表明,EVS 在保持语义忠诚度的同时显著减少 token 数量,实现更快的推理和更长的输入序列。应用于推理阶段,EVS 将大型语言模型 (LLM) 的首词延迟 (TTFT) 最多可降低 4 倍,同时保持最小精度损失。结合使用随机削减率进行上调训练,EVS 可产生对压缩程度具有鲁棒性的模型,在激进削减下仍能保持完整性能。广泛实验表明,EVS 持续改善效率-精度权衡,无需牺牲质量即可实现可扩展的视频语言理解。

关键词

引用

@article{arxiv.2510.14624,
  title  = {Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference},
  author = {Natan Bagrov and Eugene Khvedchenia and Borys Tymchenko and Shay Aharon and Lior Kadoch and Tomer Keren and Ofri Masad and Yonatan Geifman and Ran Zilberstein and Tuomas Rintamaki and Matthieu Le and Andrew Tao},
  journal= {arXiv preprint arXiv:2510.14624},
  year   = {2025}
}