面向创意布局到图像生成的双模态扩散转换器:CreatiLayout
计算机视觉与模式识别
2025-08-07 v3
摘要
扩散模型因其能够生成不仅视觉上吸引人且具有高度艺术性的图像而备受推崇。因此,布局到图像(L2I)生成被提出以利用区域特定位置和描述,实现更精确、可控的生成。然而,先前的方法主要聚焦于基于 UNet 的模型(例如 SD1.5 和 SDXL),且对探索多模态扩散转换器(MM-DiTs)的尝试有限,而 MM-DiTs 已显示出强大的图像生成能力。虽然为布局到图像生成启用 MM-DiT 看似直接,但实际存在诸多挑战,主要源于布局如何被引入、集成以及在多模态间的平衡的复杂性。为此,我们探索了多种网络变体,高效地将布局指导纳入 MM-DiT,从而最终提出了 SiamLayout。为了继承 MM-DiT 的优势,我们使用一组独立的网络权重处理布局,将其视为与图像和文本等 modality 同样重要。与此同时,为缓解不同 modality 之间的竞争,我们将图像-布局交互解耦为一个并行的 siamese 分支,与图像-文本分支一起在后期阶段进行融合。此外,我们贡献了一个大型布局数据集,命名为 LayoutSAM,包含 270 万图像-文本对和 1070 万实体。每个实体都标注了边界框和详细描述。我们进一步构建了 LayoutSAM-Eval 基准,作为评估 L2I 生成质量的综合工具。最后,我们引入了 Layout Designer,通过大型语言模型在布局规划中的潜力,将其转化为布局生成与优化的专家。这些组件共同构成了 CreatiLayout——一个系统化解决方案,将布局模型、数据集和规划器集成为创意布局到图像生成系统。
引用
@article{arxiv.2412.03859,
title = {CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation},
author = {Hui Zhang and Dexiang Hong and Yitong Wang and Jie Shao and Xinglong Wu and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2412.03859},
year = {2025}
}
备注
Accepted by ICCV 2025