STAY Diffusion:用于多样化布局到图像生成的样式化布局扩散模型
计算机视觉与模式识别
2025-03-18 v1
摘要
在布局到图像(L2I)合成中,从边界框等粗略信息生成受控的复杂场景。由于输入布局为生成过程提供了强有力的指导,同时又能被人轻松重新配置,因此该任务对许多下游应用具有吸引力。在本文中,我们提出了 STyled LAYout Diffusion(STAY Diffusion),一种基于扩散的模型,能够生成照片级真实感图像,并提供对场景中样式化对象的细粒度控制。我们的方法为每个布局学习一个全局条件,并通过一种新颖的边缘感知归一化(EA Norm)学习一个自监督语义图用于权重调制。还引入了一种新的样式化掩码注意力(SM Attention),用于将全局条件和图像特征交叉条件化,以捕捉对象之间的关系。这些措施为模型提供了一致的指导,使图像生成更加准确和可控。广泛的基准测试表明,我们的 STAY Diffusion 在生成质量上表现优异,同时在生成多样性、准确性和可控性方面超越了先前最先进的方法。
引用
@article{arxiv.2503.12213,
title = {STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation},
author = {Ruyu Wang and Xuefeng Hou and Sabrina Schmedding and Marco F. Huber},
journal= {arXiv preprint arXiv:2503.12213},
year = {2025}
}
备注
Accepted by WACV2025