SCP-Diff:基于扩散模型的语义图像合成的空间-类别联合先验
计算机视觉与模式识别
2025-09-16 v3
摘要
语义图像合成(SIS)在传感器仿真中显示出良好的前景。然而,当前该领域的最佳实践基于GAN,尚未达到理想的质量水平。随着潜在扩散模型在图像生成方面取得显著进展,我们开始评估ControlNet这一方法在密集控制方面的突出表现。我们的调查发现,其结果存在两个主要问题:大范围语义区域内出现异常子结构,以及内容与语义掩码的错位。通过经验研究,我们锁定了这些问题的根源:训练数据分布与推理阶段应用的标准正态先验之间的不匹配。为解决这一挑战,我们为SIS开发了特定噪声先验,包括空间先验、类别先验以及一种新颖的空间-类别联合先验用于推理。我们称之为SCP-Diff。该方法在Cityscapes、ADE20K和COCO-Stuff上的SIS中实现了新的最先进技术,Cityscapes上的FID最低可达10.53。代码和模型可通过项目页面获取。
关键词
引用
@article{arxiv.2403.09638,
title = {SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image Synthesis},
author = {Huan-ang Gao and Mingju Gao and Jiaju Li and Wenyi Li and Rong Zhi and Hao Tang and Hao Zhao},
journal= {arXiv preprint arXiv:2403.09638},
year = {2025}
}
备注
Project Page: https://air-discover.github.io/SCP-Diff/