LightVLM:通过金字塔 Token 合并与 KV 缓存压缩加速大型多模态模型
代数几何
2025-09-03 v1
摘要
本文提出LightVLM,是一种简单而有效的方法,可无缝部署在现有的视觉语言模型 (VLM) 上,以显著训练-free 方式加速推理过程。我们将 VLM 的推理过程分为编码阶段和解码阶段,提出在两个阶段同时加速 VLM,以大幅提升模型效率。在编码阶段,我们提出金字塔 token 合并,通过层级方式减少不同 LLM 层的 token,最终仅保留少数主导 token,以实现高效。在解码阶段,针对输出长序列的高延迟问题,提出 KV 缓存压缩以移除不必要的缓存,从而提升网络吞吐量。实验结果表明,LightVLM 在仅保留35%图像 token 的情况下成功保留100%性能,在仅保留3%图像 token 时保持约98%性能。LightVLM 可使网络吞吐量提升2.02倍,预填充时间缩短3.65倍。LightVLM 还能让大型 VLM 再快一些,通过使重型模型(如InternVL2.5 26B)的推理速度快于显著较小的模型(如InternVL2.5 8B),从而促进实际部署。当生成长文本序列(如4096个 token)时,LightVLM 可将推理时间缩短3.21倍,显著优于现有方法。
引用
@article{arxiv.2509.00418,
title = {Rank three representations of Painleve systems: III. Dolbeault structure, spectral correspondence},
author = {Miklos Eper and Szilard Szabo},
journal= {arXiv preprint arXiv:2509.00418},
year = {2025}
}
备注
43 pages, 6 Figures in colour