Add-SD:无需手动参考的理性生成
计算机视觉与模式识别
2024-07-31 v1
摘要
扩散模型在视觉泛化方面展现出惊人的能力。基于此成功,我们提出一种基于指令的对象添加管道,命名为Add-SD,能够在合理大小和位置上自动插入现实场景中的对象。不同于基于布局的条件方法,Add-SD仅依赖于简单文本提示,无需其他人力昂贵的参考(如边界框)。我们的工作在三个方面做出贡献:提出包含大量指令图像对的数据集;针对理性生成微调扩散模型;生成大规模合成数据以提升下游任务性能。首先,我们创建了一个RemovalDataset,包含原始-编辑后图像对及文本指令,其中从原始图像中移除了对象且背景保持高度像素一致性。这些数据对随后用于微调Stable Diffusion(SD)模型。随后,预训练的Add-SD模型可在合理依据下将预期对象插入图像中。此外,我们生成大规模合成实例用于下游任务数据集,尤其针对尾部类别,以缓解长尾问题。下游任务受益于数据丰富、多样且更具依据性的数据集。在LVIS验证集上实验表明,Add-SD相较于基线在稀有类别上提升了4.3个mAP。代码和模型已发布于 https://github.com/ylingfeng/Add-SD。
引用
@article{arxiv.2407.21016,
title = {Add-SD: Rational Generation without Manual Reference},
author = {Lingfeng Yang and Xinyu Zhang and Xiang Li and Jinwen Chen and Kun Yao and Gang Zhang and Errui Ding and Lingqiao Liu and Jingdong Wang and Jian Yang},
journal= {arXiv preprint arXiv:2407.21016},
year = {2024}
}