中文

基于引导扩散模型的空文本反演用于真实图像编辑

计算机视觉与模式识别 2022-11-18 v1

摘要

近期的文本引导扩散模型提供了强大的图像生成能力。目前,大量研究工作致力于仅使用文本来修改这些图像,以提供直观且多功能的编辑方式。要使用这些最先进的工具编辑真实图像,必须首先借助有意义的文本提示将图像反演到预训练模型的域中。本文中,我们引入了一种精确的反演技术,从而促进了基于文本的直观图像修改。我们提出的反演包含两个新颖的关键组件:(i) 针对扩散模型的关键反演(Pivotal inversion)。当前方法旨在将随机噪声样本映射到单个输入图像,而我们在每个时间戳使用一个单一的关键噪声向量并围绕其进行优化。我们证明直接反演本身并不充分,但确实为我们的优化提供了良好的锚点。(ii) 空文本(NULL-text)优化,其中我们仅修改用于无分类器引导的无条件文本嵌入,而非输入文本嵌入。这使得模型权重和条件嵌入都保持完好,从而能够应用基于提示的编辑,同时避免繁琐的模型权重调优。我们基于公开可用的 Stable Diffusion 模型的空文本反演,在各种图像和提示编辑上进行了广泛评估,展示了对真实图像的高保真编辑。

关键词

引用

@article{arxiv.2211.09794,
  title  = {Null-text Inversion for Editing Real Images using Guided Diffusion Models},
  author = {Ron Mokady and Amir Hertz and Kfir Aberman and Yael Pritch and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2211.09794},
  year   = {2022}
}