SimInversion:一个简单的基于反演的文本驱动图像编辑框架
计算机视觉与模式识别
2024-09-17 v1
摘要
扩散模型在文本引导下展现出了令人印象深刻的图像生成性能。受扩散学习过程的启发,现有图像可以通过 DDIM 反演根据文本进行编辑。然而,原始的 DDIM 反演并未针对无分类器引导进行优化,且累积误差会导致不理想的性能。虽然已经开发了许多算法来改进用于编辑的 DDIM 反演框架,但在这项工作中,我们研究了 DDIM 反演中的近似误差,并提议为源分支和目标分支解耦引导尺度,以在保持原始框架的同时减少误差。此外,在理论上可以推导出比默认设置更好的引导尺度(即 0.5)。在 PIE-Bench 上的实验表明,我们的方案可以在不牺牲效率的情况下显著提高 DDIM 反演的性能。
引用
@article{arxiv.2409.10476,
title = {SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing},
author = {Qi Qian and Haiyang Xu and Ming Yan and Juhua Hu},
journal= {arXiv preprint arXiv:2409.10476},
year = {2024}
}