GM-Skip:面向高效视觉语言模型的度量引导的 Transformer 块跳过策略
计算机视觉与模式识别
2025-08-26 v1
摘要
基于 Transformer 的视觉语言模型(VLM)在图像字幕、目标识别和视觉推理等任务上取得了显著的性能,但其高计算成本阻碍了在自动驾驶等延迟敏感型应用的部署。我们引入 GM-Skip,一个灵活且度量自适应的 Transformer 块跳过框架,通过度量反馈(如准确率、CIDEr)识别冗余层,加速 VLM 推理,同时保持输出质量。GM-Skip 采用贪心、度量引导的块选择策略,结合逆序删除机制,保留早期基础块以避免性能崩溃。为满足多样化的部署需求,框架内置可调节的稀疏性与性能权衡目标。跨越多项任务与数据集的实验结果(包括 COCO 和 CODA)表明,GM-Skip 在保持任务性能的同时持续提升推理速度。在 COCO 数据集上,GM-Skip 将单目标分类在 Person 类别上的准确率从 19.1% 提升至 87.3%,并跳过超过 40% 的 Transformer 块。在实际部署中,其集成至 Autoware.Universe 自动驾驶系统后,单目标检测延迟降低最高可达 45.4%,验证了其跳过配置的有效性,并确认了加速实际推理的实用价值。
关键词
引用
@article{arxiv.2508.18227,
title = {GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models},
author = {Lianming Huang and Haibo Hu and Qiao Li and Xin He and Nan Guan and Chun Jason Xue},
journal= {arXiv preprint arXiv:2508.18227},
year = {2025}
}
备注
7 pages