DiffUHaul:一种无需训练的对象拖动图像方法
计算机视觉与模式识别
2024-12-17 v2 图形学
机器学习
摘要
文本到图像扩散模型已被证明在解决许多图像编辑任务方面效果显著。然而,看似直接的在场景中无缝移动对象的任务却意外地具有挑战性。现有方法往往在现实场景中难以可靠运行,因缺乏空间推理能力。本文提出一种无需训练的方法,称为 DiffUHaul,利用局部文本到图像模型的空间理解能力来完成对象拖动任务。盲目操控局部模型的布局输入会导致编辑性能低下,由于模型中对象表示的内在纠缠。为此,我们首先在每个去噪步骤中应用注意力掩码,以使生成在不同对象之间更具解耦性,同时采用自注意力共享机制以保留高阶对象外观。进一步,我们提出了一种新的扩散锚定技术:在早期去噪步骤中,通过插值源图像和目标图像的注意力特征来平滑融合新布局与原始外观;在后期去噪步骤中,将源图像的局部特征传递给插值图像,以保留细粒度对象细节。为适应真实图像编辑,我们应用 DDPM 自注意力分桶技术,以更好地重建真实图像。最后,我们引入了一个用于该任务的自动化评估管道,展示了我们方法的有效性。我们的结果通过用户偏好研究得到强化。
引用
@article{arxiv.2406.01594,
title = {DiffUHaul: A Training-Free Method for Object Dragging in Images},
author = {Omri Avrahami and Rinon Gal and Gal Chechik and Ohad Fried and Dani Lischinski and Arash Vahdat and Weili Nie},
journal= {arXiv preprint arXiv:2406.01594},
year = {2024}
}
备注
Accepted to SIGGRAPH Asia 2024. Project page is available at https://omriavrahami.com/diffuhaul/