中文

通过协同重要性-多样性压缩视觉token:PruneSID

计算机视觉与模式识别 2026-03-12 v2

摘要

视觉语言模型(VLMs)因生成过多视觉token而面临显著计算效率问题。虽然已有研究表明大比例视觉token是冗余的,但现有压缩方法难以在重要性保存和信息多样性之间取得平衡。为此,我们提出PruneSID,一种基于协同重要性-多样性的训练-free方法,包含两个阶段:(1)主导语义组件分析(PSCA),用于将token聚类为语义连贯的组,确保概念全面覆盖;(2)组内非最大抑制(NMS),用于在保留每个组中关键代表token的同时消除冗余token。此外,PruneSID集成了信息感知的动态压缩比率机制,基于图像复杂度优化token压缩率,实现对不同场景中更有效的平均信息保留。广泛的实验表明,PruneSID实现了最佳性能,在仅保留11.1% token的情况下即可达到96.3%的准确率(LLaVA-1.5),在极端压缩率(5.6%)下亦达到92.8%的准确率(LLaVA-NeXT),显著优于基线方法。我们的框架在 diverse VLMs和两种图像和视频模态上均表现出强大的跨模态 versatility。代码可在 https://github.com/ZhengyaoFang/PruneSID 获取。

关键词

引用

@article{arxiv.2603.09480,
  title  = {Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity},
  author = {Zhengyao Fang and Pengyuan Lyu and Chengquan Zhang and Guangming Lu and Jun Yu and Wenjie Pei},
  journal= {arXiv preprint arXiv:2603.09480},
  year   = {2026}
}

备注

accepted by ICLR2026