中文

RCP: 用于缓解大型视觉语言模型中分布偏移的表示一致性剪枝器

计算机视觉与模式识别 2026-04-08 v1

摘要

大型视觉语言模型(LVLMs)由于语言解码器处理的视觉标记数量庞大而面临高昂的推理成本。现有的剪枝方法通常导致显著的性能下降,因为视觉标记的不可逆移除会在隐藏状态中引起分布偏移,使其偏离预训练的完整标记范式。为了解决这一问题,我们提出了表示一致性剪枝器(RCP),这是一个将累积视觉标记剪枝与延迟修复机制相结合的新框架。具体而言,我们引入了一种交叉注意力剪枝器,利用大型语言模型的内在注意力作为基线来预测累积掩码,确保各层之间的一致且单调的标记缩减。为了补偿由此产生的信息损失,我们设计了一个延迟修复适配器(DRA),它缓存被剪枝标记的本质,并对答案生成标记应用基于 FiLM 的调制。我们使用修复损失来使被剪枝表示的一阶和二阶统计量与完整标记教师模型匹配。RCP 高度高效,因为它仅训练轻量级即插即用模块,同时允许在推理时物理丢弃标记。在 LVLM 基准测试上的广泛实验表明,RCP 最多可移除 88.9% 的视觉标记,并将 FLOPs 降低多达 85.7%,平均精度仅略有下降,在多个广泛使用的基准测试上优于避免微调原始模型的先前方法。

关键词

引用

@article{arxiv.2604.04972,
  title  = {RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models},
  author = {Jianwei Zhang and Chaoning Zhang and Sihan Cao and Wang Liu and Pengcheng Zheng and Jiaxin Huang and Caiyan Qin and Yalan Ye and Wei Dong and Yang Yang},
  journal= {arXiv preprint arXiv:2604.04972},
  year   = {2026}
}