中文

PyramidDrop:通过金字塔视觉冗余降低加速大型视觉-语言模型

计算机视觉与模式识别 2025-02-28 v2 计算与语言

摘要

在大型视觉-语言模型(LVMM)中,图像作为输入承载着丰富的信息。正如“一张图片胜于千言万语”所暗示的,当前LVMM需要数百乃至数千个标记来表示单张图像。这导致计算成本显著增加,随输入图像分辨率呈二次增长,从而严重影响训练和推理效率。以往方法尝试在LVMM的前端或早期层数内或其中减少图像标记,但这些策略不可避免地导致关键图像信息丢失,最终降低模型性能。为此,我们进行经验研究,发现视觉标记在浅层对LVMM至关重要,标记冗余随模型深层次逐渐增加。基于此,我们提出PyramidDrop,一种面向LVMM的视觉冗余降低策略,以提升训练和推理效率,同时保持性能。具体而言,我们将LVMM划分为多个阶段,在每个阶段末端按预定义比例丢弃部分图像标记,形成跨模型层的金字塔状视觉标记。该丢弃基于轻量级相似度计算,时间开销可忽略。广泛实验表明,PyramidDrop可使LLaVA-NeXT训练时间加速40%,推理FLOPs加速55%,且性能相当。此外,PyramidDrop还可作为无需训练的推理加速策略,性能更好且推理成本更低。代码已公开。

关键词

引用

@article{arxiv.2410.17247,
  title  = {PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction},
  author = {Long Xing and Qidong Huang and Xiaoyi Dong and Jiajie Lu and Pan Zhang and Yuhang Zang and Yuhang Cao and Conghui He and Jiaqi Wang and Feng Wu and Dahua Lin},
  journal= {arXiv preprint arXiv:2410.17247},
  year   = {2025}
}

备注

CVPR 2025, code is available at https://github.com/Cooperx521/PyramidDrop