中文

利用扩散模型中 h-空间的无训练内容注入

计算机视觉与模式识别 2024-01-05 v2

摘要

扩散模型(DMs)能在多个领域合成高质量图像。然而,由于其生成过程中的中间变量尚未被严格研究,对其生成过程的控制仍不明晰。近来,人们发现 U-Net 的瓶颈特征(即 hh-空间)承载了生成图像的语义信息,这使得在 DMs 中能够实现类似 StyleCLIP 的隐空间编辑。本文进一步探索了 hh-空间在属性编辑之外的用途,并提出了一种通过在生成过程中融合两幅图像的特征,将一幅图像的内容注入另一幅图像的方法。简言之,给定另一幅图像原有的生成过程,1)我们逐步混合内容的瓶颈特征并施加适当的归一化,2)我们校准跳跃连接以匹配注入的内容。与定制扩散(custom-diffusion)方法不同,我们的方法不需要耗时的优化或微调,而是在前馈生成过程中对中间特征进行操作。此外,我们的方法不需要来自外部网络的监督。代码见 https://curryjung.github.io/InjectFusion/

关键词

引用

@article{arxiv.2303.15403,
  title  = {Training-free Content Injection using h-space in Diffusion Models},
  author = {Jaeseok Jeong and Mingi Kwon and Youngjung Uh},
  journal= {arXiv preprint arXiv:2303.15403},
  year   = {2024}
}