DiffPop:基于可信度引导的对象放置扩散模型用于图像合成
计算机视觉与模式识别
2024-06-13 v1
摘要
本文针对实现可信的对象放置以解决现实图像合成这一具有挑战性的任务问题,提出了 DiffPop——首个利用可信度引导的去噪扩散概率模型框架,以学习多个对象之间的尺度和空间关系及其对应的场景图像。首先,我们训练一个无引导扩散模型,以自监督方式直接学习对象放置参数。随后,我们开发了人类在环管线,利用扩散生成的合成图像的人类标注提供结构可信度分类器的弱监督训练。该分类器进一步用于引导扩散采样过程,以生成可信的对象放置。实验结果表明,我们的方法在新的 Cityscapes-OP 数据集和公开的 OPA 数据集上,能够产生可信且多样化的合成图像,同时展示了其在数据增强和多对象放置任务等应用场景中的潜力。我们的数据集和代码将进行公开释放。
引用
@article{arxiv.2406.07852,
title = {DiffPop: Plausibility-Guided Object Placement Diffusion for Image Composition},
author = {Jiacheng Liu and Hang Zhou and Shida Wei and Rui Ma},
journal= {arXiv preprint arXiv:2406.07852},
year = {2024}
}