面向高效大型多模态模型的紧凑视觉标记学习
计算机视觉与模式识别
2025-06-10 v1
摘要
大型多模态模型 (LMM) 由于大型语言模型 (LLM) 的高计算成本以及处理长视觉标记序列的二次复杂度,面临显著的计算挑战。本文探索视觉标记之间的空间冗余性,缩短视觉标记序列的长度以实现推理加速。具体而言,我们提出了空间标记融合 (STF) 方法,用于学习紧凑的视觉标记,以实现短视觉标记序列,其中空间相邻标记被融合为一个。同时,权重冻结的视觉编码器无法很好地适应广泛的下游视觉语言任务的需求。为了解决这一问题,我们进一步引入了多块标记融合 (MBTF) 模块,用于为缩减后的标记序列提供多粒度特征。总体而言,我们将STF和MBTF模块组合在一起,在标记减少和信息保留之间取得平衡,从而在不牺牲多模态推理能力的前提下提高推理效率。实验结果表明,我们的方法基于 LLaVA-1.5 在 8 个流行的视觉语言基准测试中,能够以与基线相当甚至更好的性能表现,仅使用基线的 视觉标记。源代码和训练好的权重可在 https://github.com/visresearch/LLaVA-STF 获取。
引用
@article{arxiv.2506.07136,
title = {Hi-VAE: Efficient Video Autoencoding with Global and Detailed Motion},
author = {Huaize Liu and Wenzhang Sun and Qiyuan Zhang and Donglin Di and Biao Gong and Hao Li and Chen Wei and Changqing Zou},
journal= {arXiv preprint arXiv:2506.07136},
year = {2025}
}