IPCV:面向 MLLM 视觉编码器的信息保留压缩
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
多模态大语言模型(MLLMs)在视觉语言任务中展现出强大的性能,但计算成本高昂,这源于大量视觉 token 由 Vision Transformer(ViT)编码器处理。现有的 token 剪枝策略不够:LLM 阶段的 token 剪枝忽略了 ViT 的开销,而传统 ViT token 剪枝缺乏语言引导,风险在于丢弃文本关键视觉线索,并引入因 ViT 双向注意力机制放大的特征失真。为应对这些挑战,我们提出了 IPCV——一种面向 MLLM 视觉编码器的、无需训练的信息保留压缩框架。IPCV 通过邻居引导重建(Neighbor-Guided Reconstruction, NGR)实现了在 ViT 内部进行激进 token 剪枝:该方法暂时重建被剪枝的 token,以最小开销参与注意力计算,然后在传递给 LLM 前完全恢复这些 token。此外,我们引入注意力稳定(Attention Stabilization, AS)机制,以近似被剪枝 token 的 K/V 来进一步缓解 token 剪枝的负面影响。该方法可直接应用于先前的 LLM 端 token 剪枝方法以提升其性能。大量实验表明,IPCV 在各类图像和视频基准测试中显著减少了端到端计算量,并优于当前主流的无需训练的 token 压缩方法。我们的代码已公开于 https://github.com/Perkzi/IPCV。
引用
@article{arxiv.2512.18747,
title = {IPCV: Information-Preserving Compression for MLLM Visual Encoders},
author = {Yuan Chen and Zichen Wen and Yuzhou Wu and Xuyang Liu and Shuang Chen and Junpeng Ma and Weijia Li and Conghui He and Linfeng Zhang},
journal= {arXiv preprint arXiv:2512.18747},
year = {2025}
}
备注
13 pages, 6 figures