Diffree: 基于扩散模型的文本引导自由形状对象填充
计算机视觉与模式识别
2024-07-25 v1 人工智能
摘要
本文解决了一个重要问题,即仅通过文本指导添加图像中的对象。由于新对象必须与图像中一致的视觉上下文(如光照、纹理和空间位置)无缝集成,因此具有挑战性。虽然现有的文本引导图像填充方法可以添加对象,但要么无法保持背景一致,要么需要繁琐的人类干预来指定边界框或用户手绘掩码。为解决此问题,我们引入 Diffree—a 文本到图像(T2I)模型,通过仅文本控制实现文本引导的对象添加。为此,我们采用先进的图像填充技术对对象进行去除,构建了 OABench—a 一个精致的合成数据集,包含原始图像、去除对象后填充的图像、对象掩码以及对象描述。使用基于 Stable Diffusion 的模型训练 Diffree,并添加掩码预测模块,Diffree 独特地预测新对象的位置,仅通过文本即可实现对象添加。大量实验表明,Diffree 在保持背景一致性、空间合适性以及对象相关性和质量方面,均能以高成功率添加新对象。
引用
@article{arxiv.2407.16982,
title = {Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model},
author = {Lirui Zhao and Tianshuo Yang and Wenqi Shao and Yuxin Zhang and Yu Qiao and Ping Luo and Kaipeng Zhang and Rongrong Ji},
journal= {arXiv preprint arXiv:2407.16982},
year = {2024}
}