LAW-Diffusion:基于布局扩散的复杂场景生成
计算机视觉与模式识别
2023-08-15 v1
摘要
得益于扩散模型的快速发展,图像合成取得了前所未有的进展。先前工作大多依赖预训练语言模型,但文本往往过于抽象而难以恰当指定图像的所有空间属性,例如场景的布局配置,导致复杂场景生成结果次优。在本文中,我们通过提出一种语义可控的布局感知(Layout-AWare)扩散模型,称为 LAW-Diffusion,实现了精确的复杂场景生成。与先前仅探索类别感知关系的布局到图像生成(L2I)方法不同,LAW-Diffusion 引入空间依赖解析器,将对象间位置感知的语义连贯性编码为布局嵌入,并生成具有感知上和谐的对象风格与上下文关系的场景。具体而言,我们将每个对象的区域语义精细实例化为对象区域图,并利用位置感知跨对象注意力模块来捕获这些解耦表示间的空间依赖。我们进一步为布局引导提出自适应引导调度,以缓解区域语义对齐与生成对象纹理保真度之间的权衡。此外,LAW-Diffusion 通过引入布局感知潜变量嫁接机制来重组其局部区域语义,允许在保持合成图像其他区域的同时进行实例重配置。为更好验证生成场景的合理性,我们为 L2I 任务提出一种新的评估指标,称为场景关系分数(SRS),用于衡量图像如何保持上下文对象间合理与和谐的关系。综合实验表明,我们的 LAW-Diffusion 产生了最先进的生成性能,尤其在对象关系连贯性方面。
引用
@article{arxiv.2308.06713,
title = {LAW-Diffusion: Complex Scene Generation by Diffusion with Layouts},
author = {Binbin Yang and Yi Luo and Ziliang Chen and Guangrun Wang and Xiaodan Liang and Liang Lin},
journal= {arXiv preprint arXiv:2308.06713},
year = {2023}
}