先思后生:基于大语言模型编码器的推理感知文本到图像扩散模型
计算机视觉与模式识别
2026-01-16 v1
摘要
文本到图像(T2I)扩散模型(DMs)的最新进展已能够从多样化的文本提示中生成高质量的视觉内容。然而,大多数现有的T2I DMs,即使是配备了基于大语言模型(LLM)的文本编码器的模型,本质上仍然是文本-像素映射器——它们仅将LLM用作文本编码器,而没有利用其固有的推理能力来推断给定文本提示应视觉描绘什么。为了超越这种字面生成,我们提出了“先思后生”(T2G)范式,其中鼓励基于LLM的文本编码器对原始用户提示进行推理和重写;重写提示的状态随后用作扩散条件。为实现这一点,我们首先通过一个轻量级的监督微调过程激活LLM编码器的“先思后写”模式。随后,通过Dual-GRPO对LLM编码器和扩散主干进行联合优化,以确保对上下文的忠实推理和对语义的准确渲染。特别地,文本编码器使用基于图像的奖励进行强化,以推断和回忆世界知识,而扩散主干则被推动生成语义一致且视觉连贯的图像。实验表明,在基于推理的图像生成和编辑基准测试中,事实一致性、语义对齐和视觉真实性均有显著提升,在WISE评分上达到0.79,几乎与GPT-4持平。我们的结果为迈向具有推理、表达和演示能力的下一代统一模型迈出了有希望的一步。
引用
@article{arxiv.2601.10332,
title = {Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders},
author = {Siqi Kou and Jiachun Jin and Zetong Zhou and Ye Ma and Yugang Wang and Quan Chen and Peng Jiang and Xiao Yang and Jun Zhu and Kai Yu and Zhijie Deng},
journal= {arXiv preprint arXiv:2601.10332},
year = {2026}
}