中文

Skip-Vision:基于自适应令牌跳过的视觉语言模型高效可扩展加速

计算机视觉与模式识别 2025-07-04 v3

摘要

基于Transformer的模型推动了多模态大语言模型(MLLMs)取得显著进展,但在扩大分辨率、训练数据和模型参数时,其计算成本会急剧上升。关键瓶颈在于用于细粒度图像理解所需的视觉令牌数量激增。我们提出Skip-Vision,一个统一框架,解决视觉语言模型在训练和推理方面的效率问题。在常规令牌压缩方法的基础上,我们引入两种互补的加速策略。对于训练加速,我们观察到对视觉令牌进行前馈网络(FFN)计算会产生边际特征更新。这激励我们提出Skip-FFN策略,跳过冗余视觉令牌的FFN层。对于推理加速,我们设计了一种选择性KV缓存移除机制,在解码过程中剪枝被跳过的键值对,同时保持模型性能。实验结果表明,Skip-Vision可将训练时间缩短最多35%,推理FLOPs降低75%,延迟降低45%,且在性能上与现有方法相当或更优。我们的工作为在提高效率的同时实现高性能MLLM的规模化提供了实用解决方案。

关键词

引用

@article{arxiv.2503.21817,
  title  = {Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping},
  author = {Weili Zeng and Ziyuan Huang and Kaixiang Ji and Yichao Yan},
  journal= {arXiv preprint arXiv:2503.21817},
  year   = {2025}
}

备注

Accepted by ICCV2025