DeCo:多模态大语言模型中令牌压缩与语义抽象的解耦
计算机视觉与模式识别
2024-06-03 v1
摘要
视觉投影器作为连接视觉和语言模态并促进跨模态对齐的关键组件,在MLLMs中起着至关重要的作用。然而,衡量投影器在视觉-语言对齐中的有效性仍未被充分探索,目前只能通过MLLMs在下游任务上的性能来推断。受此问题启发,本研究通过解释MLLMs内部的视觉-语言语义流来审视投影器模块。具体来说,我们追溯从生成的语言令牌到原始视觉编码器补丁以及投影器产生的中间输出的语义相关性流。我们的发现表明,压缩型投影器(例如QFormer)将视觉补丁抽象为有限数量的语义概念(如对象或属性),导致“双重抽象”现象。这包括投影器根据预定义的查询令牌进行的第一次视觉语义抽象,以及LLM根据文本指令进行的第二次提取。双重抽象在训练中效率低下,并会导致累积的视觉语义缺陷。为缓解此问题,我们提出关键见解“将压缩与抽象解耦(DeCo)”,即通过投影器在补丁级别压缩视觉令牌数量,并让LLM完全处理视觉语义抽象。因此,我们采用一个简单的压缩器,即二维自适应池化,以无参数方式对视觉补丁进行下采样。实证评估表明,DeCo在性能和效率方面均优于传统的压缩型投影器。在MLLM基准测试、视觉定位和开放式VQA任务中,DeCo以更少的可训练参数和更快的收敛速度分别实现了0.9%、7.1%和2.9%的性能提升。
引用
@article{arxiv.2405.20985,
title = {DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models},
author = {Linli Yao and Lei Li and Shuhuai Ren and Lean Wang and Yuanxin Liu and Xu Sun and Lu Hou},
journal= {arXiv preprint arXiv:2405.20985},
year = {2024}
}