MiniGPT-4:以先进大语言模型增强视觉-语言理解
计算机视觉与模式识别
2023-10-03 v2
摘要
近期的GPT-4展现出非凡的多模态能力,例如从手写文本直接生成网页、识别图像中的幽默元素。这些特性在以往的视觉-语言模型中鲜有观测。然而,GPT-4背后的技术细节仍不为外界所知。我们认为GPT-4增强的多模态生成能力源于对先进大语言模型(LLM)的利用。为检验这一现象,我们提出MiniGPT-4,其通过一个投影层将冻结的视觉编码器与冻结的先进LLM(Vicuna)对齐。我们的工作首次揭示:将视觉特征与先进大语言模型恰当对齐,可具备GPT-4所展现的众多高级多模态能力,如详尽的图像描述生成与从手绘草图创建网页。此外,我们也在MiniGPT-4中观察到其他涌现能力,包括由给定图像启发撰写故事与诗歌、基于食物照片教导用户烹饪等。实验中我们发现,在短图像-描述对上训练的模型会产生不自然的语言输出(如重复与碎片化)。为解决该问题,我们在第二阶段整理了一个详尽图像描述数据集对模型微调,从而提升了模型生成的可靠性与整体可用性。我们的代码、预训练模型与所收集数据集发布于https://minigpt-4.github.io/。
引用
@article{arxiv.2304.10592,
title = {MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models},
author = {Deyao Zhu and Jun Chen and Xiaoqian Shen and Xiang Li and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2304.10592},
year = {2023}
}
备注
Project Website: https://minigpt-4.github.io/; Code, Pretrained Model, and Dataset: https://github.com/Vision-CAIR/MiniGPT-4; Deyao Zhu and Jun Chen contributed equally to this work