中文

ConsensusDrop:融合视觉与跨模态显著性的高效视觉语言模型

计算机视觉与模式识别 2026-02-03 v1

摘要

视觉语言模型(VLM)因 LLM 处理大量冗余视觉标记而昂贵。现有标记减少方法通常要么利用视觉编码器显著性(宽但查询不可知),要么利用 LLM 跨注意力(查询感知但稀疏且代价高)。我们表明单一信号都不足够:将它们融合一致优于单模态视觉标记选择(排序)。然而,使此类融合实用并非易事:跨模态显著性通常仅在 LLM 内部可用(太晚无法高效预LLM剪枝),且两种信号本质上不对称,导致朴素融合未能充分利用其互补优势。我们提出 ConsensusDrop,一个无训练框架,通过协调视觉编码器显著性与查询感知跨注意力,派生出一致性排序,在压缩剩余标记时保留最信息丰富的标记,通过编码器引导的标记合并。跨 LLaVA-1.5/NeXT、Video-LLaVA 等开源 VLM,ConsensusDrop 在相同标记预算下一致优于先前剪枝方法,实现更强的准确率-效率 Pareto 前沿——即使在激进的标记减少下,仍能保持接近基准的准确率,同时降低响应时间和 KV 缓存占用。我们的代码将公开源码。

关键词

引用

@article{arxiv.2602.00946,
  title  = {ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models},
  author = {Dhruv Parikh and Haoyang Fan and Rajgopal Kannan and Viktor Prasanna},
  journal= {arXiv preprint arXiv:2602.00946},
  year   = {2026}
}

备注

Technical Report