中文

基于大语言模型和扩散模型的布局控制图像生成双阶段系统

计算机视觉与模式识别 2025-11-12 v2

摘要

文本到图像扩散模型显示出惊人的生成能力,但缺乏对对象数量和空间布局的精确控制。本工作引入了一个双阶段系统以解决这些构图局限。第一阶段采用大语言模型(LLM)从对象列表生成结构化布局。第二阶段使用布局条件扩散模型生成遵循该布局的照片写实图像。我们发现,任务分解对 LLM 基于空间规划至关重要;通过将初始生成简化为核心对象并采用规则化插入方式完成布局,可将复杂场景的对象召回率从 57.2% 提升至 99.9%。对于图像合成,我们比较了两种主要条件方法:ControlNet 和 GLIGEN。在基于餐桌布置数据集进行特定领域微调后,我们确定了关键权衡:ControlNet 保持基于文本的风格控制,但存在对象幻觉问题;而 GLIGEN 在布局保真度方面表现更优,但以牺牲基于提示的可控性为代价。我们的端到端系统成功生成具有指定对象数量和合理空间布局的图像,证明了解耦方法在构图受控合成方面的可行性。

关键词

引用

@article{arxiv.2511.06888,
  title  = {A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models},
  author = {Jan-Hendrik Koch and Jonas Krumme and Konrad Gadzicki},
  journal= {arXiv preprint arXiv:2511.06888},
  year   = {2025}
}

备注

12 pages, 5 figures