中文

面向大型视觉语言模型的解耦相似度任务感知标记裁剪

计算机视觉与模式识别 2026-04-14 v1

摘要

标记裁剪已成为有效降低大型视觉语言模型(LVM)计算开销的方法,通过丢弃不信息丰富的视觉标记而保留性能。然而,现有方法通常依赖于来自不同LVM组件的单个注意力来源,导致由于注意力分布偏差,裁剪决策不完整且次优。为此,我们提出了DeSAP,即Decoupled Similarity-Aware Pruning,一种用于视觉编码器内精确、任务感知的标记裁剪方法。具体而言,DeSAP引入一种解耦相似度,以捕获视觉特征与文本标记之间细粒度的跨模态相关性,为裁剪提供明确的任务相关指导。通过将解耦相似度与从视觉注意力中派生的视觉显著性信号相集成,DeSAP在任务相关和视觉线索的指导下进行标记裁剪,在激进裁剪比率下仍能实现稳健的裁剪。广泛的实验表明,DeSAP在准确率和效率方面均优于SOTA方法。在LLaVA-1.5-7B模型上,DeSAP实现了10倍的FLOPs减少和2.3倍的预填加速,仅保留11.1%的视觉标记,同时保持98.1%的原始性能。

关键词

引用

@article{arxiv.2604.11240,
  title  = {Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models},
  author = {Kexin Ma and Jing Xiao and Chaofeng Chen and Geyong Min and Guibo Zhu and Jinqiao Wang and Liang Liao},
  journal= {arXiv preprint arXiv:2604.11240},
  year   = {2026}
}