中文

无妥协的效率提升——在 LMM 中挤压计算冗余

计算机视觉与模式识别 2025-05-22 v1

摘要

大型多模态模型在多模态任务中表现出色,但因在视觉标记上执行过多计算而面临重大的计算挑战。与专注于标记层冗余的标记降低方法不同,我们识别并研究了视觉标记上的计算层冗余,以确保不损失信息。我们的关键洞察是,来自预训练视觉编码器的视觉标记并不必然需要在 decoder-only LMM 中执行所有重型操作(如自注意力、FFN),可以以恰当的设计方式更轻松地处理。我们设计了一系列实验来发现并逐步挤压视觉相关的计算冗余。基于我们的发现,我们提出了 ProxyV—a 一种新方法,利用代理视觉标记来减轻原始视觉标记的计算负担。ProxyV 在不损失性能的情况下增强了效率,甚至在效率改进较为温和的场景中也能实现显著的性能提升。此外,ProxyV 的灵活性通过与标记降低方法的组合进一步提升了效率。代码将在本 https://github.com/penghao-wu/ProxyV URL 上公开。

关键词

引用

@article{arxiv.2505.15816,
  title  = {Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM},
  author = {Penghao Wu and Lewei Lu and Ziwei Liu},
  journal= {arXiv preprint arXiv:2505.15816},
  year   = {2025}
}

备注

ICML 2025