中文

VisionZip:视觉语言模型中,更长并非必要

计算机视觉与模式识别 2026-03-17 v2 人工智能 计算与语言 机器学习

摘要

视觉语言模型的最新进展通过增加视觉token的长度来提升性能,这使得视觉token远长于文本token,并显著增加了计算成本。然而,我们观察到,流行的视觉编码器(如CLIP和SigLIP)生成的视觉token包含大量冗余。为了解决这个问题,我们引入了VisionZip,这是一种简单而有效的方法,它选择一组信息量丰富的token输入到语言模型,在保持模型性能的同时减少视觉token冗余并提高效率。所提出的VisionZip可广泛应用于图像和视频理解任务,并且非常适合多轮对话等实际场景,而此前的方法在这些场景中往往表现不佳。实验结果表明,在几乎所有设置下,VisionZip的性能均比之前最先进的方法高出至少5%。此外,我们的方法显著提高了模型推理速度,将预填充时间提高了8倍,使得LLaVA-Next 13B模型的推理速度快于LLaVA-Next 7B模型,同时取得了更好的结果。此外,我们分析了这种冗余的原因,并鼓励社区专注于提取更好的视觉特征,而不仅仅是增加token长度。我们的代码可在 https://github.com/dvlab-research/VisionZip 获取。

关键词

引用

@article{arxiv.2412.04467,
  title  = {VisionZip: Longer is Better but Not Necessary in Vision Language Models},
  author = {Senqiao Yang and Yukang Chen and Zhuotao Tian and Chengyao Wang and Jingyao Li and Bei Yu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2412.04467},
  year   = {2026}
}

备注

Code: https://github.com/dvlab-research/VisionZip