中文

VISA:基于图摘要的组级视觉标记选择与聚合,提高多模态大语言模型推理效率

计算机视觉与模式识别 2025-08-26 v1 人工智能

摘要

本研究引入了一种新方法,称为组级视觉标记选择与聚合(VISA),以解决多模态大语言模型(MLLMs)因视觉标记过多导致的推理效率低下问题。与以往的标记剪枝方法相比,我们的方法能够在压缩视觉标记的同时保留更多视觉信息。我们首先提出一种基于图的视觉标记聚合(VTA)模块。VTA 将每个视觉标记视为节点,基于视觉标记之间的语义相似性构建图谱,然后根据图谱将被删除标记的信息聚合到保留标记中,从而产生更紧凑的视觉标记表示。此外,我们引入了一种基于每组最终层文本标记引导的组级标记选择策略(GTS),将视觉标记分为保留标记和删除标记。该策略逐步聚合视觉信息,增强了视觉信息提取过程的稳定性。我们在 LLaVA-1.5、LLaVA-NeXT 和 Video-LLaVA 上进行了全面的实验,以验证 VISA 的有效性。我们的方法在各类基准测试中始终优于先前方法,在模型性能与推理速度之间实现了卓越的权衡。代码已公开于 https://github.com/mobiushy/VISA。

关键词

引用

@article{arxiv.2508.17857,
  title  = {VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference},
  author = {Pengfei Jiang and Hanjun Li and Linglan Zhao and Fei Chao and Ke Yan and Shouhong Ding and Rongrong Ji},
  journal= {arXiv preprint arXiv:2508.17857},
  year   = {2025}
}

备注

Accepted by ACMMM 2025