MiniGPT-5:通过生成式 Vokens 实现交错视觉与语言生成
计算机视觉与模式识别
2025-12-10 v4 人工智能
摘要
多模态大语言模型(MLLMs)的有效性展现出其在多模态理解上的深厚能力。然而,图像与连贯文本的同时生成仍不成熟。为此,我们引入一种新颖的交错视觉与语言生成方法,围绕“生成式 vokens”这一概念展开。这些 vokens 是促成连贯图文输出的关键要素。我们的方法以独特的无描述多模态生成两阶段训练策略为标志,无需大量图像描述。我们集成无分类器引导以增强生成图像与文本的对齐,确保更无缝且上下文相关的多模态交互。我们的模型 MiniGPT-5 在多模态生成数据集(包括 MMDialog 与 VIST)上相较基线模型有显著提升。人工评估显示 MiniGPT-5 在多模态生成上优于基线模型的案例超 56%,凸显了其在多样基准上的效能。
引用
@article{arxiv.2310.02239,
title = {MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens},
author = {Kaizhi Zheng and Xuehai He and Xin Eric Wang},
journal= {arXiv preprint arXiv:2310.02239},
year = {2025}
}