通过修复来绘制:先移除再学习添加图像对象
计算机视觉与模式识别
2025-03-21 v3 人工智能
摘要
图像编辑随着文本条件扩散模型的引入取得了显著进展。尽管取得了这些进展,但根据文本指令无缝地向图像中添加对象而无需用户提供输入掩码仍然是一个挑战。我们通过利用一个洞察来解决这个问题:移除对象(Inpaint)比其逆过程添加对象(Paint)要简单得多,这归因于受益于分割掩码引导的修复模型。基于这一认识,通过实现自动化和广泛的流程,我们整理了一个经过筛选的大规模图像数据集,其中包含图像及其对应的对象移除版本。利用这些配对,我们训练一个扩散模型来逆转修复过程,有效地将对象添加到图像中。与其他编辑数据集不同,我们的数据集具有自然的目标图像而不是合成图像,同时通过构造确保源-目标一致性。此外,我们利用大型视觉语言模型提供被移除对象的详细描述,并利用大型语言模型将这些描述转换为多样化的自然语言指令。我们的定量和定性结果表明,训练后的模型在对象添加和一般编辑任务上都超越了现有模型。请访问我们的项目页面获取发布的数据集和训练模型:https://rotsteinnoam.github.io/Paint-by-Inpaint。
引用
@article{arxiv.2404.18212,
title = {Paint by Inpaint: Learning to Add Image Objects by Removing Them First},
author = {Navve Wasserman and Noam Rotstein and Roy Ganz and Ron Kimmel},
journal= {arXiv preprint arXiv:2404.18212},
year = {2025}
}