通过标记合并与修剪实现多模态 LLM 的自适应推理
计算机视觉与模式识别
2025-07-30 v2 人工智能
计算与语言
摘要
大型语言模型 (LLM) 已促进了多模态 LLM 的创建,这些模型在处理图像和视频等视觉数据的理解能力方面表现强劲。然而,这些模型通常依赖于视觉编码器提供的大量视觉标记,导致计算需求高,限制了其在资源受限环境和长上下文任务中的适用性。在本工作中,我们提出了一种用于多模态 LLM 的训练-free 自适应推理方法,可满足广泛的效率要求,同时保持最小性能下降。我们的方法包括 a) 在 LLM 之前基于嵌入相似性进行迭代标记合并,和 b) 基于多模态重要性在 LLM 各层中进行渐进式标记修剪。通过简约设计,本方法可同时应用于视频和图像 LLM。对多样化的视频和图像基准进行大规模实验表明,本方法显著减少计算负载(例如 的 FLOPs 降低),同时保持视频和图像 LLM 的性能。进一步地,在类似计算成本下,本方法在长视频理解任务中优于最新方法(例如 在 MLVU 上)。此外,我们的深入分析提供了关于标记冗余和 LLM 层行为的见解,为在设计高效多模态 LLM 方面的未来研究提供了指导。我们的代码可在 https://github.com/LaVi-Lab/AIM 提供。
引用
@article{arxiv.2412.03248,
title = {AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning},
author = {Yiwu Zhong and Zhuoming Liu and Yin Li and Liwei Wang},
journal= {arXiv preprint arXiv:2412.03248},
year = {2025}
}
备注
Accepted to ICCV 2025