中文

SimInversion:一个简单的基于反演的文本驱动图像编辑框架

计算机视觉与模式识别 2024-09-17 v1

摘要

扩散模型在文本引导下展现出了令人印象深刻的图像生成性能。受扩散学习过程的启发,现有图像可以通过 DDIM 反演根据文本进行编辑。然而,原始的 DDIM 反演并未针对无分类器引导进行优化,且累积误差会导致不理想的性能。虽然已经开发了许多算法来改进用于编辑的 DDIM 反演框架,但在这项工作中,我们研究了 DDIM 反演中的近似误差,并提议为源分支和目标分支解耦引导尺度,以在保持原始框架的同时减少误差。此外,在理论上可以推导出比默认设置更好的引导尺度(即 0.5)。在 PIE-Bench 上的实验表明,我们的方案可以在不牺牲效率的情况下显著提高 DDIM 反演的性能。

关键词

引用

@article{arxiv.2409.10476,
  title  = {SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing},
  author = {Qi Qian and Haiyang Xu and Ming Yan and Juhua Hu},
  journal= {arXiv preprint arXiv:2409.10476},
  year   = {2024}
}