理解驱动的生成:通过将理解融入生成强化统一模型的生成能力
计算机视觉与模式识别
2025-09-26 v3
摘要
近期的工作通过思维链在增强用于文本到图像生成的统一模型方面取得了显著进展。然而,这些推理方法将理解和生成过程分离,限制了它们在解决统一模型生成能力缺陷时对其推理的引导作用。为此,我们提出了一种面向统一模型的新型推理框架,即理解驱动的生成,利用统一模型强大的理解能力来增强其在图像生成中的表现。我们 UiG 的核心思想是在推理过程中通过强大的理解能力整合生成指导,从而缓解生成能力的局限性。为实现这一点,我们引入“图像编辑”作为将理解融入生成过程的桥梁。首先,我们验证生成的图像,并将统一模型的理解结合到编辑指令中。随后,我们逐步增强生成的图像,逐步将理解融入生成过程。我们的 UiG 框架在文本到图像生成方面相较于现有的文本到图像推理方法展现出显著的性能提升,例如,在 TIIF 基准的长提示设置上获得了 3.92% 的增益。项目代码:https://github.com/QC-LY/UiG
引用
@article{arxiv.2509.18639,
title = {Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation},
author = {Yuanhuiyi Lyu and Chi Kit Wong and Chenfei Liao and Lutao Jiang and Xu Zheng and Zexin Lu and Linfeng Zhang and Xuming Hu},
journal= {arXiv preprint arXiv:2509.18639},
year = {2025}
}