Add-it: 基于预训练扩散模型的免训练图像物体插入
计算机视觉与模式识别
2024-11-13 v2 人工智能
图形学
机器学习
摘要
根据文本指令向图像中添加物体是语义图像编辑中的一项挑战性任务,需要在保留原始场景与将新物体无缝融入合适位置之间取得平衡。尽管投入了大量努力,现有模型往往难以实现这种平衡,特别是在复杂场景中为添加物体寻找自然位置方面。我们提出了 Add-it,一种免训练方法,它扩展了扩散模型的注意力机制,以融合来自三个关键来源的信息:场景图像、文本提示和生成图像本身。我们的加权扩展注意力机制在保持结构一致性和精细细节的同时,确保物体放置的自然性。无需针对特定任务微调,Add-it 在真实和生成图像插入基准上均达到最先进水平,包括我们新构建的“添加适配性基准”,用于评估物体放置的合理性,超越了有监督方法。人工评估显示,Add-it 在超过 80% 的情况下更受青睐,且在各类自动化指标上也有提升。
引用
@article{arxiv.2411.07232,
title = {Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models},
author = {Yoad Tewel and Rinon Gal and Dvir Samuel and Yuval Atzmon and Lior Wolf and Gal Chechik},
journal= {arXiv preprint arXiv:2411.07232},
year = {2024}
}
备注
Project page is at https://research.nvidia.com/labs/par/addit/