中文

通过修剪交叉注意视觉特征实现高效 LLaMA-3.2-Vision

计算机视觉与模式识别 2025-04-02 v1 机器学习

摘要

视觉标记减少大型视觉语言模型(LVLMs)中因广泛图像特征导致的推理成本。不同于针对仅采用自注意力机制的LVLMs的相关研究,本工作独特地针对实现卓越性能的交叉注意力模型进行工作。我们识别到,交叉注意力层中图像标记的 key-value(KV) 缓存大小显著超过自注意力层中文本标记的 KV 缓存,这构成了主要的计算瓶颈。为缓解此问题,我们利用交叉注意力图中的稀疏性,对选择性修剪冗余视觉特征。我们的修剪版 Llama 能在无需额外训练的情况下降低 KV 缓存需求。通过降低 50% 的视觉特征,我们的模型可在保持基准测试持平性的同时,显著减少推理延迟和内存使用。

关键词

引用

@article{arxiv.2504.00557,
  title  = {Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features},
  author = {Jewon Lee and Ki-Ung Song and Seungmin Yang and Donguk Lim and Jaeyeon Kim and Wooksu Shin and Bo-Kyeong Kim and Yong Jae Lee and Tae-Ho Kim},
  journal= {arXiv preprint arXiv:2504.00557},
  year   = {2025}
}

备注

accepted at CVPR 2025 Workshop on ELVM