基于文本引导扩散模型的显著对象感知背景生成
计算机视觉与模式识别
2024-04-17 v1 机器学习
摘要
为显著对象生成背景场景在创意设计和电子商务等多个领域发挥着关键作用,它通过将主体融入定制环境来增强其呈现效果和上下文关联。背景生成可被框架化为文本条件的外扩任务,其目标是在空白背景上扩展图像内容至显著对象边界之外。尽管流行的文本引导内补扩散模型也可通过掩码反转用于外扩,但它们训练用于填充图像缺失部分,而非将对象放置到场景中。因此,当用于背景创建时,内补模型常常扩展显著对象的边界,从而改变对象身份,我们将此现象称为“对象扩展”。本文介绍了一种使用Stable Diffusion和ControlNet架构将内补扩散模型适配到显著对象外扩任务的模型。我们展示了跨模型和数据集的一系列定性和定量结果,包括一项新提出的无需人工标注即可测量对象扩展的指标。与Stable Diffusion 2.0 Inpainting相比,我们提出的方法在多个数据集上将对象扩展平均减少了3.6倍,且标准视觉指标无退化。
引用
@article{arxiv.2404.10157,
title = {Salient Object-Aware Background Generation using Text-Guided Diffusion Models},
author = {Amir Erfan Eshratifar and Joao V. B. Soares and Kapil Thadani and Shaunak Mishra and Mikhail Kuznetsov and Yueh-Ning Ku and Paloma de Juan},
journal= {arXiv preprint arXiv:2404.10157},
year = {2024}
}
备注
Accepted for publication at CVPR 2024's Generative Models for Computer Vision workshop