中文

Diffree: 基于扩散模型的文本引导自由形状对象填充

计算机视觉与模式识别 2024-07-25 v1 人工智能

摘要

本文解决了一个重要问题,即仅通过文本指导添加图像中的对象。由于新对象必须与图像中一致的视觉上下文(如光照、纹理和空间位置)无缝集成,因此具有挑战性。虽然现有的文本引导图像填充方法可以添加对象,但要么无法保持背景一致,要么需要繁琐的人类干预来指定边界框或用户手绘掩码。为解决此问题,我们引入 Diffree—a 文本到图像(T2I)模型,通过仅文本控制实现文本引导的对象添加。为此,我们采用先进的图像填充技术对对象进行去除,构建了 OABench—a 一个精致的合成数据集,包含原始图像、去除对象后填充的图像、对象掩码以及对象描述。使用基于 Stable Diffusion 的模型训练 Diffree,并添加掩码预测模块,Diffree 独特地预测新对象的位置,仅通过文本即可实现对象添加。大量实验表明,Diffree 在保持背景一致性、空间合适性以及对象相关性和质量方面,均能以高成功率添加新对象。

关键词

引用

@article{arxiv.2407.16982,
  title  = {Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model},
  author = {Lirui Zhao and Tianshuo Yang and Wenqi Shao and Yuxin Zhang and Yu Qiao and Ping Luo and Kaipeng Zhang and Rongrong Ji},
  journal= {arXiv preprint arXiv:2407.16982},
  year   = {2024}
}