Forge-and-Quench:增强统一多模态模型图像生成的高保真度
计算机视觉与模式识别
2026-01-09 v1
摘要
将图像生成与理解整合至单一框架已成为多模态领域的核心目标。然而,理解如何有效辅助生成尚未得到充分探索。不同于以往侧重利用理解模型推理能力与世界知识的工作,本文提出了一种新视角:利用理解来增强生成图像的保真度与细节丰富度。为此,我们提出 Forge-and-Quench,一个将此原则付诸实践的新型统一框架。在我们框架的生成过程中,MLLM 首先对包含文本指令在内的整个对话上下文进行推理,以生成增强的文本指令。随后,通过一个新颖的 Bridge Adapter,将此精炼后的指令映射为称为 Bridge Feature 的虚拟视觉表示。该特征作为关键纽带,将理解模型的洞见注入(forge)以淬炼(quench)并优化生成过程。它随后作为视觉引导信号,连同替换原始输入的增强文本指令一起被注入 T2I 主干网络。为验证此范式,我们对 Bridge Feature 与 Bridge Adapter 的设计进行了全面研究。我们的框架展现出卓越的可扩展性与灵活性,能够高效迁移至不同的 MLLM 与 T2I 模型,显著节省训练开销,且不损害 MLLM 固有的多模态理解能力。实验表明,Forge-and-Quench 在多个模型上显著提升了图像保真度与细节,同时保持了指令遵循的准确性并增强了世界知识的应用。模型与代码可在 https://github.com/YanbingZeng/Forge-and-Quench 获取。
引用
@article{arxiv.2601.04706,
title = {Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models},
author = {Yanbing Zeng and Jia Wang and Hanghang Ma and Junqiang Wu and Jie Zhu and Xiaoming Wei and Jie Hu},
journal= {arXiv preprint arXiv:2601.04706},
year = {2026}
}