中文

零样本图像到图像翻译

计算机视觉与模式识别 2023-02-07 v1 图形学 机器学习

摘要

大规模文本到图像生成模型已展现出合成多样且高质量图像的卓越能力。然而,由于两个原因,直接将这些模型用于编辑真实图像仍具挑战。首先,用户很难想出一个完美的文本提示来精确描述输入图像中的每个视觉细节。其次,尽管现有模型可在某些区域引入期望的变化,它们往往大幅改变输入内容并在不期望的区域引入意外变化。本工作中,我们提出pix2pix-zero,一种无需手动提示即可保留原始图像内容的图像到图像翻译方法。我们首先自动发现反映文本嵌入空间中期望编辑的编辑方向。为保留编辑后的总体内容结构,我们进一步提出交叉注意力引导,旨在整个扩散过程中保留输入图像的交叉注意力图。此外,我们的方法无需针对这些编辑进行额外训练,可直接使用现有的预训练文本到图像扩散模型。我们进行了大量实验,表明我们的方法在真实和合成图像编辑上均优于现有及同期工作。

关键词

引用

@article{arxiv.2302.03027,
  title  = {Zero-shot Image-to-Image Translation},
  author = {Gaurav Parmar and Krishna Kumar Singh and Richard Zhang and Yijun Li and Jingwan Lu and Jun-Yan Zhu},
  journal= {arXiv preprint arXiv:2302.03027},
  year   = {2023}
}

备注

website: https://pix2pixzero.github.io/