中文

HiCoGen:基于强化学习的扩散模型层次化组合文本到图像生成

计算机视觉与模式识别 2025-11-26 v1

摘要

近期扩散模型在生成简单提示词的高质量图像方面取得了显著进展。然而面对包含多个物体和层次结构的复杂提示词,现有模型难以准确遵循指令,导致概念遗漏、混淆和组合性差等问题。为此,我们提出一种基于新颖Synthesis链(Chain of Synthesis, CoS)范式的层次化组合生成框架(Hierarchical Compositional Generative framework, HiCoGen)。该框架首先利用大型语言模型(LLM)将复杂提示词分解为最小语义单元,然后依次合成这些单元,其中每一步生成的图像为下一步提供关键视觉上下文,确保所有文本概念faithfully构建至最终场景中。为进一步优化此过程,我们引入强化学习(RL)框架。我们认识到,标准扩散采样器的探索有限是制约有效RL的关键因素。我们理论证明,样本多样性通过集中于生成早期阶段的随机性来最大化;基于此洞见,我们提出一种新颖的衰减随机性计划(Decaying Stochasticity Schedule)以增强探索。我们的RL算法由分层奖励机制驱动,同时在全局、主体和关系三个层面对图像进行评估。我们还构建了HiCoPrompt——一个用于严格评估的、包含层次化提示词的文本到图像基准数据集。实验表明,我们的方法在概念覆盖率和组合精确度方面均显著优于现有方法。

关键词

引用

@article{arxiv.2511.19965,
  title  = {HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning},
  author = {Hongji Yang and Yucheng Zhou and Wencheng Han and Runzhou Tao and Zhongying Qiu and Jianfei Yang and Jianbing Shen},
  journal= {arXiv preprint arXiv:2511.19965},
  year   = {2025}
}

备注

9 pages