中文

Sparse-to-Dense:LLM 中视频理解无损加速的免费午餐

计算机视觉与模式识别 2026-05-19 v2 计算与语言

摘要

由于当前视频大语言模型 的自回归特性,推理延迟随输入序列长度的增加而增加,这给通常很长的视频序列的高效处理带来了挑战。我们观察到,在解码过程中,Video-LLM 中大多数 token 的注意力分数倾向于稀疏且集中,只有某些 token 需要全面的全注意力。基于这一洞察,我们引入了 Sparse-to-Dense (StD),一种集成了两个不同模块的新型解码策略:一个利用稀疏 top-K 注意力,另一个采用密集全注意力。这些模块协作以无损地加速 Video-LLM。快速(稀疏)模型推测性地解码多个 token,而慢速(密集)模型并行验证它们。StD 是一种免调优、即插即用的解决方案,在视频处理中实现了高达 1.94×\times 的实际时间加速。它保持了模型性能,同时能够以极少的代码修改实现从标准 Video-LLM 到稀疏 Video-LLM 的无缝转换。

关键词

引用

@article{arxiv.2505.19155,
  title  = {Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs},
  author = {Xuan Zhang and Cunxiao Du and Sicheng Yu and Jiawei Wu and Fengzhuo Zhang and Wei Gao and Qian Liu},
  journal= {arXiv preprint arXiv:2505.19155},
  year   = {2026}
}

备注

Accepted by ACL 2025