中文

MI-Pruner:基于跨模态互信息引导的高效多模态大语言模型Token修剪器

计算机视觉与模式识别 2026-04-06 v1

摘要

对于多模态大语言模型 (MLLMs),视觉信息相对于文本而言相对稀疏。因此,针对视觉修剪涌现出来,以实现高效推理。当前方法通常基于视觉编码器中的注意力得分或LLM解码器中的注意力得分来衡量token重要性,然后选择注意力得分高的视觉token,修剪其他token。本文 pursuit了一种不同且更精细的路径。我们直接计算视觉特征与文本特征之间的互信息 (MI),在它们相互作用之前进行计算。这使得我们能够在特征层面显式衡量跨模态依赖。我们的MI-Pruner方法简单、高效且不具侵入性,无需访问内部注意力图或修改网络结构。实验结果表明,我们的方法在最小延迟下超越了基于注意力的先前修剪方法。

关键词

引用

@article{arxiv.2604.03072,
  title  = {MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs},
  author = {Jiameng Li and Aleksei Tiulpin and Matthew B. Blaschko},
  journal= {arXiv preprint arXiv:2604.03072},
  year   = {2026}
}

备注

9 pages