通过多实例视觉提示生成器增强多模态大语言模型中的视觉表征
计算机视觉与模式识别
2024-06-06 v1
摘要
多模态大语言模型(MLLMs)通过融合视觉表征并利用视觉适配器与大语言模型集成,已在各种视觉语言任务中实现最先进性能。本文首先确立了基于查询的变换器(如 Q-former)作为一种简化的多实例学习方法,由于未考虑实例异质性/相关性。随后,我们提出了一种名为多实例视觉提示生成器(Multi-instance Visual Prompt Generator, MIVPG)的通用组件,通过利用同一样本中图像或 patch 之间的实例相关性,将丰富的视觉表征纳入大语言模型。在来自不同场景的三个公开视觉语言数据集上的定量评估表明,提出的 MIVPG 在主要视觉语言任务中均优于 Q-former。
引用
@article{arxiv.2406.02987,
title = {Enhancing Multimodal Large Language Models with Multi-instance Visual Prompt Generator for Visual Representation Enrichment},
author = {Wenliang Zhong and Wenyi Wu and Qi Li and Rob Barton and Boxin Du and Shioulin Sam and Karim Bouyarmane and Ismail Tutar and Junzhou Huang},
journal= {arXiv preprint arXiv:2406.02987},
year = {2024}
}