PixelMan:通过像素操作与生成实现扩散模型的一致对象编辑
计算机视觉与模式识别
2025-01-31 v2 人工智能
图形学
摘要
最近的研究探索了扩散模型(DMs)在一致对象编辑中的潜力,旨在修改对象位置、大小和构图等,同时保持对象和背景的一致性而不改变其纹理和属性。当前的推理时间方法通常依赖于DDIM反演,这固有地降低了效率和编辑图像的可实现一致性。最近的方法还使用能量引导,迭代更新预测噪声,并可能使潜在变量偏离原始图像,导致失真。在本文中,我们提出了PixelMan,一种无反向传播、无训练的方法,通过像素操作和生成实现一致的对象编辑,其中我们直接在像素空间中在目标位置创建源对象的副本,并引入一种高效的采样方法,迭代地将操作后的对象协调到目标位置并修复其原始位置,同时通过将待生成的编辑图像锚定到像素操作后的图像以及在推理过程中引入各种保持一致性的优化技术来确保图像一致性。基于基准数据集的实验评估以及广泛的视觉比较表明,在仅需16个推理步骤的情况下,PixelMan在多个一致对象编辑任务上优于一系列最先进的基于训练和无训练的方法(通常需要50步)。
引用
@article{arxiv.2412.14283,
title = {PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation},
author = {Liyao Jiang and Negar Hassanpour and Mohammad Salameh and Mohammadreza Samadi and Jiao He and Fengyu Sun and Di Niu},
journal= {arXiv preprint arXiv:2412.14283},
year = {2025}
}
备注
AAAI 2025; version includes supplementary material; 27 Pages, 15 Figures, 6 Tables