M$^{2}$Chat:赋能 VLM 实现多模态 LLM 交错文本-图像生成
计算机视觉与模式识别
2025-08-08 v3
摘要
尽管当前如 GPT-4V 等 LLM 聊天机器人弥合了人类指令与视觉表征之间的差距以实现文本-图像生成,它们仍缺乏高效的对齐方法以在多个下游任务上获得高保真性能。本文中,我们提出 \textbf{},一种新颖的统一多模态 LLM 框架,用于跨多种场景生成交错文本-图像对话。具体而言,我们提出 ,其高效整合来自多模态提示的细粒度低级视觉信息与高级语义特征。基于良好对齐的融合特征, 定制可学习门控策略,以自适应平衡不同任务间的模型创造力与一致性。此外,为进一步提升 有效性同时保持语义上下文理解的一致性,我们引入两阶段 微调策略。该策略分别优化用于图像-文本对齐与视觉指令的不相交参数组。大量实验表明,我们的 在多个基准上超越最先进的同类方法,展现了其在交错生成、故事叙述和多模态对话系统中的能力。演示与代码见 \red{https://mattie-e.github.io/M2Chat.github.io}。
引用
@article{arxiv.2311.17963,
title = {M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation},
author = {Xiaowei Chi and Junbo Qi and Rongyu Zhang and Shanghang Zhang and Qifeng Liu and Yike Guo},
journal= {arXiv preprint arXiv:2311.17963},
year = {2025}
}