潜在扩散模型中的无梯度解码器逆变
机器学习
2024-09-30 v1 计算机视觉与模式识别
摘要
在潜在扩散模型(LDMs)中,去噪扩散过程有效地在潜空间中进行,其维度低于像素空间。解码器通常用于将潜空间中的表示转换为像素空间中的表示。虽然假设解码器拥有准确的编码器作为逆函数,但即使在实际应用中需要精确的解码器逆变的情况下,准确的编码器-解码器对也很少存在。先前的 LDMs 中用于解码器逆变的方法采用了受生成对抗网络逆变启发的梯度下降方法。然而,梯度方法需要更大的 GPU 内存和更长的计算时间才能处理更大的潜空间。例如,最近的视频 LDMs 可以生成超过 16 帧,但仅能使用 24 GB 内存的 GPU 对 4 帧进行梯度-based 解码器逆变。我们提出了一种高效的无梯度解码器逆变方法,可应用于各种潜模型。我们研究了本提议逆变方法的理论收敛性,不仅适用于前向步骤方法,也适用于在 cocoericity 条件(即最近 LDMs 满足的条件)下的惯性克拉斯诺索尔基曼(Krasnoselskii-Mann)迭代。我们提议的无梯度方法结合 Adam 优化器和学习率调度,显著减少了计算时间和内存使用,优于先前的基于梯度的方法,并在噪声空间水印等应用中实现了可效计算,同时达到可比的误差水平。
引用
@article{arxiv.2409.18442,
title = {Gradient-free Decoder Inversion in Latent Diffusion Models},
author = {Seongmin Hong and Suh Yoon Jeon and Kyeonghyun Lee and Ernest K. Ryu and Se Young Chun},
journal= {arXiv preprint arXiv:2409.18442},
year = {2024}
}
备注
19 pages, Accepted to NeurIPS 2024