D2Pruner:去偏重要性与结构多样性用于 MLLM Token 剪枝
计算机视觉与模式识别
2025-12-29 v2
摘要
处理长序列视觉 token 对多模态大语言模型(MLLMs)构成重大的计算负担。虽然 token 剪枝提供了加速之路,但我们发现当前方法虽适用于一般理解,却在细粒度定位任务中 catastrophic 失败。我们将此失败归因于两种主流策略固有的缺陷:基于重要性的方法受到强烈位置偏差的影响,这是一种内在模型特征,会干扰语义内容;而基于多样性的方法则表现出结构盲区,忽略了用户提示和空间冗余。为此,我们引入 D2Pruner 框架,通过独特地结合去偏重要性与结构剪枝机制来纠正这些问题。我们的方法首先基于去偏注意力得分确定最关键的 token 子集作为枢轴,然后在剩余 token 上执行最大独立集(MIS)选择,这些 token 建模于混合图上,图中的边代表空间接近性和语义相似性。此过程迭代地保留最重要且可用的 token,同时移除其邻居,确保补充 token 在重要性和多样性方面获得最大化。大量实验表明,D2Pruner 在效率和保真度方面表现卓越。应用于 LLaVA-1.5-7B 进行一般理解任务,可将 FLOPs 降低 74.2%,同时保留 99.2% 的原始性能。此外,在针对 InternVL-2.5-8B 的挑战性定位基准中,达到 90% token 剪枝率时保持 85.7% 的性能,为现有方法带来了最高可达 63.53% 的显著性提升。
引用
@article{arxiv.2512.19443,
title = {D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning},
author = {Evelyn Zhang and Fufu Yu and Aoqi Wu and Zichen Wen and Ke Yan and Shouhong Ding and Biqing Qi and Linfeng Zhang},
journal= {arXiv preprint arXiv:2512.19443},
year = {2025}
}