面向高效多模态大语言模型的显著性-覆盖导向标记修剪
计算机视觉与模式识别
2025-10-29 v1
摘要
多模态大语言模型(MLLMs)通常处理大量视觉标记,导致计算开销巨大,尽管其中许多标记是冗余的。现有的视觉标记修剪方法主要关注基于注意力得分选择最显著的标记,导致所选标记的语义不完整。在本文中,我们提出一种新的视觉标记修剪策略,称为 SCOPE(Saliency-Coverage Oriented token Pruning for Efficient MLLMs),以更好地保留语义完整性,同时建模所选视觉标记的显著性和覆盖率。具体而言,我们基于标记之间的关系计算给定所选标记集合的集合覆盖。随后,我们定义每个未选标记的标记覆盖增益,量化将其包含在内可获得的额外覆盖量。通过将显著性得分整合到标记覆盖增益中,我们提出了我们的 SCOPE 得分,并迭代选择得分最高的标记。我们在使用 LLaVA-1.5 和 LLaVA-Next 模型进行的多个视觉语言理解基准测试中进行了广泛实验。实验结果表明,我们的方法始终优于先前方法。我们的代码可在 https://github.com/kinredon/SCOPE 获取。
引用
@article{arxiv.2510.24214,
title = {SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs},
author = {Jinhong Deng and Wen Li and Joey Tianyi Zhou and Yang He},
journal= {arXiv preprint arXiv:2510.24214},
year = {2025}
}
备注
NeurIPS 2025