中文

将视觉Token视为文本?但你的多模态大语言模型只需更少的努力就能看见

计算机视觉与模式识别 2024-12-03 v3

摘要

通过将来自视觉编码器的视觉token视为文本token,多模态大语言模型利用大语言模型的强大架构,在各种视觉理解任务中取得了显著进展。然而,随着token数量的增长,大语言模型中计算的二次方缩放引入了显著的效率瓶颈,阻碍了进一步的扩展性。尽管最近的方法探索了修剪视觉token或采用更轻量级的大语言模型架构,但来自不断增加视觉token数量的计算开销仍然是一个重大挑战。在本研究中,我们在代表性多模态大语言模型LLaVA中,从参数和计算模式两个层面研究了视觉计算中的冗余,并引入了一套精简策略以提高效率。这些策略包括邻域感知的视觉token注意力、修剪非活跃的视觉注意力头,以及针对视觉计算的选择性层丢弃。通过在LLaVA中实施这些策略,我们在保持关键基准测试性能的同时,将计算需求降低了88%。此外,我们验证了其他多模态大语言模型(如Qwen2-VL-7B和InternVL-2.0-4B/8B/26B)中也存在视觉计算冗余。这些结果为多模态大语言模型以最小计算成本处理密集视觉token提供了一条新途径。代码和模型检查点将发布以支持进一步研究。

关键词

引用

@article{arxiv.2410.06169,
  title  = {Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See},
  author = {Zeliang Zhang and Phu Pham and Wentian Zhao and Kun Wan and Yu-Jhe Li and Jianing Zhou and Daniel Miranda and Ajinkya Kale and Chenliang Xu},
  journal= {arXiv preprint arXiv:2410.06169},
  year   = {2024}
}