通过蒸馏和强化学习生长多头枝干以加速大型视觉语言模型
摘要
大型视觉语言模型 (Vision-Language Models, VLMs) 在开放式多模态理解方面展现了卓越的能力,但其高计算开销为实际部署带来了巨大挑战。一些最近的工作提出了通过修剪冗余视觉标记以加速 VLMs的方法,这些方法受到 VLM 早期层注意力图的指导。尽管这些标记修剪方法取得了成功,但它们仍存在两个主要局限性:(i) 由于注意力信号在早期层上不够敏感,导致显著的精度下降;(ii) 在生成长回复(例如 30 个标记)时,加速效果有限。为了解决上述局限性,我们提出了 TwigVLM -- 一种简单且通用的架构,通过在基础 VLM 的早期层上生长一个轻量模块(称为 twig)来实现加速。与大多数基于纯视觉标记修剪的现有 VLM 加速方法相比,我们的 TwigVLM 不仅通过采用 twig-guided token pruning (TTP) 策略实现更好的精度保持,还通过利用自特推断 (self-speculative decoding, SSD) 策略实现更高的生成速度。以 LLaVA-1.5-7B 为基础 VLM 为例,实验结果表明,TwigVLM 在修剪 88.9% 的视觉标记后仍保留了 96% 的原始性能,并在生成长回复时实现 154% 的加速, 在准确率和速度方面均优于最新的 VLM 加速方法。此外,我们通过引入具有专门化修剪头的多头 twig 架构,将 TwigVLM 扩展为改进版 TwigVLM++,通过结合蒸馏学习阶段和面向修剪的强化学习阶段来提高修剪质量,并通过基于树的 SSD 策略进一步加速推理。
引用
@article{arxiv.2503.14075,
title = {Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models},
author = {Zhenwei Shao and Mingyang Wang and Weijun Zhang and Zhou Yu and Wenwen Pan and Yan Yang and Tao Wei and Hongyuan Zhang and Jun Yu},
journal= {arXiv preprint arXiv:2503.14075},
year = {2026}
}
备注
An extended version of our ICCV paper at https://openaccess.thecvf.com/content/ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html