BuboGPT:在多模态大语言模型中实现视觉定位
计算机视觉与模式识别
2023-07-18 v1 人工智能
摘要
LLM 已展现出通过语言与人类交互的卓越能力,尤其是借助指令跟随数据。LLM 近期的进展,如 MiniGPT-4、LLaVA 和 X-LLM,通过融入图像、视频和语音等多模态输入进一步扩大了其能力。尽管这些 LLM 在生成给定模态信号的精确且详细的语言理解方面有效,但它们放弃了定位输入特定部分的能力,从而仅构建了粗粒度映射。然而,文本与其他模态之间明确且信息丰富的对应不仅将改善用户体验,还有助于拓展多模态 LLM 的应用场景。因此,我们提出 BuboGPT,一种具有视觉定位的多模态 LLM,能够执行视觉、音频与语言之间的跨模态交互,提供对视觉对象及其他给定模态的细粒度理解。因此,BuboGPT 能够在为图像中某对象生成回复或描述时,指出该对象在图像中的具体位置。我们的贡献有两点:1) 基于 SAM 的即用型视觉定位模块,可提取句子中的实体并在图像中找到对应掩码。2) 两阶段训练方案与指令数据集,以赋予联合文本-图像-音频理解能力。我们的实验表明,BuboGPT 在与人类交互过程中实现了令人印象深刻的多模态理解与视觉定位能力。在提供任意模态组合(无论对齐或未对齐)时,它均表现稳定良好。我们的代码、模型和数据集可在 https://bubo-gpt.github.io 获取。
引用
@article{arxiv.2307.08581,
title = {BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs},
author = {Yang Zhao and Zhijie Lin and Daquan Zhou and Zilong Huang and Jiashi Feng and Bingyi Kang},
journal= {arXiv preprint arXiv:2307.08581},
year = {2023}
}