iLLaVA:图像在大型多模态模型中仅占少于1/3的输入标记
计算机视觉与模式识别
2026-03-10 v2
摘要
近期方法在利用视觉输入内在冗余性加速大型视觉语言模型(Large Vision-Language Models, LVLMs)方面取得了显著进展。然而,大多数现有方法仅聚焦于在大型语言模型(LLM)阶段前或内部减少图像标记,以降低计算成本,忽略了图像编码器本身的主要瓶颈。由于图像编码器是输入标记到LLM的主要贡献者,本文提出iLLaVA,通过联合优化图像编码器、LLM及其他LVLM组件,实现全面的加速。为缓解因标记减少导致的性能下降风险,本文提出一种新颖的标记合并策略,以回收被丢弃标记中有用的信息。我们的方法iLLaVA在图像和视频理解任务中均实现了一致的改进,实现了最高可达2倍的吞吐量提升和4倍的填充时间减少。值得注意的是,iLLaVA使更大模型(如InternVL-2.5 26B)在准确率和效率上均超越较小模型(如InternVL-2.5 8B)。与最新状态的标记修剪和合并技术进行广泛比较,显示出我们方法的显著优势。最后,我们提供iLLaVA合并步骤的详细可视化,深入探讨不同LVLM组件如何贡献于高效计算。
引用
@article{arxiv.2412.06263,
title = {iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models},
author = {Lianyu Hu and Liqing Gao and Fanhua Shang and Liang Wan and Wei Feng},
journal= {arXiv preprint arXiv:2412.06263},
year = {2026}
}
备注
Accepted by ICLR2026,code is released at https://github.com/hulianyuyy/iLLaVA