Forgedit:通过学习与遗忘实现文本引导图像编辑
计算机视觉与模式识别
2024-03-19 v2
摘要
给定仅原始图像本身与目标文本提示作为输入,对真实或合成图像进行文本引导图像编辑是一项非常通用且具挑战性的任务。它要求编辑模型自行估计图像的哪部分应被编辑,然后在保持原图像特征的同时执行刚性或非刚性编辑。在本文中,我们设计了一种新颖的文本引导图像编辑方法,命名为 Forgedit。首先,我们提出一种视觉-语言联合优化框架,能够在 30 秒内重建原始图像,远快于先前 SOTA 且过拟合少得多。接着我们提出一种扩散模型文本嵌入空间中的新颖向量投影机制,能够分别控制身份相似度与编辑强度。最后,我们发现扩散模型中 UNet 的一个通用属性,即 Unet 编码器学习空间与结构,Unet 解码器学习外观与身份。利用该属性,我们设计遗忘机制,成功解决了在单张图像上微调扩散模型时致命且不可避免的过拟合问题,从而显著提升扩散模型的编辑能力。我们的方法 Forgedit 构建于 Stable Diffusion 之上,在具挑战性的文本引导图像编辑基准 TEdBench 上取得了新的 SOTA 结果,在 CLIP 分数与 LPIPS 分数方面均超越先前如基于 Imagen 的 Imagic 等 SOTA 方法。代码可见于 https://github.com/witcherofresearch/Forgedit
引用
@article{arxiv.2309.10556,
title = {Forgedit: Text Guided Image Editing via Learning and Forgetting},
author = {Shiwen Zhang and Shuai Xiao and Weilin Huang},
journal= {arXiv preprint arXiv:2309.10556},
year = {2024}
}
备注
Codes are available at https://github.com/witcherofresearch/Forgedit