中文

D2Pruner:去偏重要性与结构多样性用于 MLLM Token 剪枝

计算机视觉与模式识别 2025-12-29 v2

摘要

处理长序列视觉 token 对多模态大语言模型(MLLMs)构成重大的计算负担。虽然 token 剪枝提供了加速之路,但我们发现当前方法虽适用于一般理解,却在细粒度定位任务中 catastrophic 失败。我们将此失败归因于两种主流策略固有的缺陷:基于重要性的方法受到强烈位置偏差的影响,这是一种内在模型特征,会干扰语义内容;而基于多样性的方法则表现出结构盲区,忽略了用户提示和空间冗余。为此,我们引入 D2Pruner 框架,通过独特地结合去偏重要性与结构剪枝机制来纠正这些问题。我们的方法首先基于去偏注意力得分确定最关键的 token 子集作为枢轴,然后在剩余 token 上执行最大独立集(MIS)选择,这些 token 建模于混合图上,图中的边代表空间接近性和语义相似性。此过程迭代地保留最重要且可用的 token,同时移除其邻居,确保补充 token 在重要性和多样性方面获得最大化。大量实验表明,D2Pruner 在效率和保真度方面表现卓越。应用于 LLaVA-1.5-7B 进行一般理解任务,可将 FLOPs 降低 74.2%,同时保留 99.2% 的原始性能。此外,在针对 InternVL-2.5-8B 的挑战性定位基准中,达到 90% token 剪枝率时保持 85.7% 的性能,为现有方法带来了最高可达 63.53% 的显著性提升。

关键词

引用

@article{arxiv.2512.19443,
  title  = {D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning},
  author = {Evelyn Zhang and Fufu Yu and Aoqi Wu and Zichen Wen and Ke Yan and Shouhong Ding and Biqing Qi and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2512.19443},
  year   = {2025}
}