中文

PIP-MM:通过现有 MLLM 结构将提示信息预集成到视觉编码中

计算机视觉与模式识别 2024-10-31 v1

摘要

多模态大语言模型(MLLMs)通过整合视觉信息激活了大语言模型(LLMs)在解决视觉-语言任务中的能力。现有 MLLMs 中的主流方法采用图像编码器提取视觉特征,通过适配器将这些特征转换为视觉标记,然后将其与提示一起整合到 LLM 中。然而,由于图像编码过程与提示无关,提取的视觉特征仅提供图像的粗略描述,无法聚焦于提示的需求。一方面,图像特征容易缺乏关于提示指定对象的信息,导致响应不令人满意;另一方面,视觉特征包含大量无关信息,这不仅增加了内存负担,还恶化了生成效果。为解决上述问题,我们提出 PIP-MM,一个利用 MLLM 现有模块将提示信息预集成到视觉编码过程中的框架。具体而言,我们利用 MLLM 中冻结的 LLM 对输入提示进行向量化,以总结提示的需求。然后,我们将提示向量输入到经过训练的多层感知器(MLP)中,使其与视觉输入需求对齐,随后替换图像编码器中的类别嵌入。由于我们的模型仅需添加一个可训练的 MLP,因此可以应用于任何 MLLM。为验证 PIP-MM 的有效性,我们在多个基准数据集上进行了实验。自动评估指标和人工评估均证明了 PIP-MM 的强大性能。特别值得注意的是,即使减少一半的视觉标记,我们的模型仍能保持出色的生成结果。

关键词

引用

@article{arxiv.2410.23089,
  title  = {PIP-MM: Pre-Integrating Prompt Information into Visual Encoding via Existing MLLM Structures},
  author = {Tianxiang Wu and Minxin Nie and Ziqiang Cao},
  journal= {arXiv preprint arXiv:2410.23089},
  year   = {2024}
}