中文

揭开MLLMs中视觉信息流的面纱:开启更快推理的路径

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

多模态大语言模型(MLLM)通过将预训练视觉编码器的视觉特征集成到大语言模型(LLM)中,提高了视觉-语言任务的性能。然而,MLLM如何处理和利用视觉信息仍不清楚。在本文中,我们揭示了视觉信息主导流的转变:(1)在浅层中,观察到图像token和指令token之间存在强烈的交互,其中大部分视觉信息被注入指令token以形成跨模态语义表示;(2)在深层中,图像token主要相互交互,聚合剩余的视觉信息以优化视觉模态内的语义表示。基于这些见解,我们提出了分层模态感知剪枝(HiMAP),这是一种即插即用的推理加速方法,可在特定层动态剪枝图像token,在不牺牲性能的情况下将计算成本降低约65%。我们的发现为MLLM中的视觉信息处理提供了新的理解,并提供了高效的SOTA推理解决方案。

关键词

引用

@article{arxiv.2503.13108,
  title  = {Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference},
  author = {Hao Yin and Guangzong Si and Zilei Wang},
  journal= {arXiv preprint arXiv:2503.13108},
  year   = {2025}
}