用于文本引导潜扩散图像编辑的对比去噪分数
计算机视觉与模式识别
2024-04-02 v2 人工智能
机器学习
摘要
随着文本到图像扩散模型的显著出现,图像编辑方法变得更加多样并持续发展。该领域一个有前景的近期方法是 Delta 去噪分数(DDS)——一种基于分数蒸馏采样(SDS)框架、利用文本到图像扩散模型丰富生成先验的图像编辑技术。然而,仅依赖评分函数之间的差异不足以保留原始图像的特定结构元素,而这是图像编辑的关键方面。为此,我们在此提出一种极其简单却非常强大的 DDS 改进,称为对比去噪分数(CDS),用于潜扩散模型(LDM)。受 DDS 与用于无配对图像到图像翻译的对比学习(CUT)之间异同的启发,我们引入了一种在 DDS 框架内使用 CUT 损失的直截了当的方法。与原始 CUT 方法使用辅助网络不同,我们利用 LDM 的中间特征,特别是来自自注意力层、具有丰富空间信息的那些特征。我们的方法实现了零样本图像到图像翻译和神经辐射场(NeRF)编辑,在输入与输出间达成结构对应,同时保持内容可控性。定性结果与对比展示了我们所提方法的有效性。项目页面:https://hyelinnam.github.io/CDS/
引用
@article{arxiv.2311.18608,
title = {Contrastive Denoising Score for Text-guided Latent Diffusion Image Editing},
author = {Hyelin Nam and Gihyun Kwon and Geon Yeong Park and Jong Chul Ye},
journal= {arXiv preprint arXiv:2311.18608},
year = {2024}
}
备注
CVPR 2024 (poster); Project page: https://hyelinnam.github.io/CDS/