中文

IterInv:面向像素级文生图模型的迭代反演

计算机视觉与模式识别 2024-04-23 v2 图形学

摘要

大规模文本到图像扩散模型在生成遵循输入文本提示的逼真图像方面取得了突破性进展。图像编辑研究的目标是让用户能够通过修改文本提示来控制生成的图像。当前的图像编辑技术主要依赖于DDIM反演,这是一种根植于潜在扩散模型(LDM)的普遍做法。然而,在潜在空间上运行的大型预训练T2I模型由于采用自编码器机制的首次压缩阶段而存在细节丢失问题。相反,其他在像素级上工作的主流T2I流水线,如Imagen和DeepFloyd-IF,规避了上述问题。它们通常由多个阶段组成,通常从文本到图像阶段开始,随后接若干个超分辨率阶段。在该流水线中,由于超分辨率扩散模型与DDIM技术不兼容,DDIM反演无法找到初始噪声并生成原始图像。根据我们的实验发现,将带噪图像作为条件迭代拼接是这一问题的根源。基于该观察,我们为这类T2I模型开发了迭代反演(IterInv)技术,并使用开源的DeepFloyd-IF模型验证了IterInv。具体而言,IterInv采用NTI作为低分辨率图像生成的反演与重建。在第2和第3阶段,我们在每个时间步更新潜在方差以找到确定性反演轨迹并促进重建过程。通过将我们的方法与一种流行的图像编辑方法结合,我们证明了IterInv的应用前景。代码将在录用后发布。代码可在\url{https://github.com/Tchuanm/IterInv.git}获取。

关键词

引用

@article{arxiv.2310.19540,
  title  = {IterInv: Iterative Inversion for Pixel-Level T2I Models},
  author = {Chuanming Tang and Kai Wang and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2310.19540},
  year   = {2024}
}

备注

Accepted paper at ICME 2024