中文

面向免训练非刚性编辑的时间步感知采样潜变量反演

计算机视觉与模式识别 2024-10-17 v3

摘要

文本引导的非刚性编辑涉及对输入图像的复杂编辑,例如改变其周围环境中的运动或构图。由于需要操纵输入结构,现有方法通常难以保持物体身份和背景,特别是在与 Stable Diffusion 结合时。在本工作中,我们提出了一种基于 Stable Diffusion 的免训练非刚性编辑方法,旨在提高身份保持质量而不损害可编辑性。我们的方法包括三个阶段:文本优化、潜变量反演和时间步感知文本注入采样。受 Imagic 成功的启发,我们采用其文本优化以实现平滑编辑。然后,我们引入潜变量反演,在无需额外模型微调的情况下保持输入图像的身份。为了充分利用潜变量反演的输入重建能力,我们建议使用时间步感知文本注入采样。该方法通过在早期采样步骤中注入源文本提示,然后在后续采样步骤中过渡到目标提示,有效地保留了输入图像的结构。这种策略方法与文本优化无缝协调,促进了对输入的复杂非刚性编辑而不丢失原始身份。我们通过大量实验证明了我们的方法在身份保持、可编辑性和美学质量方面的有效性。

关键词

引用

@article{arxiv.2402.08601,
  title  = {Latent Inversion with Timestep-aware Sampling for Training-free Non-rigid Editing},
  author = {Yunji Jung and Seokju Lee and Tair Djanibekov and Hyunjung Shim and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2402.08601},
  year   = {2024}
}

备注

This manuscript has been submitted to Pattern Recognition Letters