EDICT:通过耦合变换实现精确扩散反演
计算机视觉与模式识别
2022-12-23 v2 人工智能
机器学习
摘要
寻找一个初始噪声向量,使其在输入扩散过程时生成输入图像(称为反演),是去噪扩散模型(DDMs)中的一个重要问题,可应用于真实图像编辑。现有基于反演的真实图像编辑最优方法使用去噪扩散隐式模型(DDIMs)将图像确定性地加噪至中间状态,该路径与给定原始条件时去噪所遵循的路径一致。然而,DDIM 对真实图像的反演不稳定,因其依赖局部线性化假设,导致误差传播,从而造成图像重建错误与内容丢失。为缓解这些问题,我们提出 EDICT(通过耦合变换实现精确扩散反演),一种受仿射耦合层启发的反演方法。EDICT 通过维护两个耦合噪声向量并以交替方式相互反演,实现对真实与模型生成图像的数学精确反演。利用最先进的隐扩散模型 Stable Diffusion,我们展示 EDICT 能高保真地重建真实图像。在 MS-COCO 等复杂图像数据集上,EDICT 重建显著优于 DDIM,将重建的均方误差改善为原来的二分之一。利用从真实图像反演得到的噪声向量,EDICT 支持从局部与全局语义编辑到图像风格化的广泛编辑,同时保持对原图像结构的保真。EDICT 无需模型训练/微调、提示调优或额外数据,且可与任何预训练 DDM 结合。代码见 https://github.com/salesforce/EDICT。
引用
@article{arxiv.2211.12446,
title = {EDICT: Exact Diffusion Inversion via Coupled Transformations},
author = {Bram Wallace and Akash Gokul and Nikhil Naik},
journal= {arXiv preprint arXiv:2211.12446},
year = {2022}
}
备注
24 pages, 22 figures. Code now available