中文

基于富提示再生学习的扩散模型零样本图像翻译

计算机视觉与模式识别 2023-05-09 v1

摘要

大规模文本到图像模型已展现出合成多样且高保真图像的惊人能力。然而,这些模型常受若干局限所困。首先,它们要求用户提供精确且语境相关的描述以进行所需的图像修改。其次,当前模型在编辑过程中会对原始图像内容施加显著改变。本文中,我们探索图像到图像扩散模型(ReDiffuser)中的再生学习(ReGeneration learning),其在无人工提示下保留原始图像内容,并在文本嵌入空间中自动发现所需的编辑方向。为确保图像编辑过程中形状的一致保留,我们提出基于再生学习的跨注意力引导。该新颖方法在保留图像原始形状的同时增强了目标域特征的表达。此外,我们引入一种协同更新策略,可高效保留图像原始形状,从而提升整个编辑过程中形状保留的质量与一致性。我们提出的方法利用了已有的预训练文本-图像扩散模型,无需任何额外训练。大量实验表明,所提方法在真实与合成图像编辑上均优于现有工作。

关键词

引用

@article{arxiv.2305.04651,
  title  = {ReGeneration Learning of Diffusion Models with Rich Prompts for Zero-Shot Image Translation},
  author = {Yupei Lin and Sen Zhang and Xiaojun Yang and Xiao Wang and Yukai Shi},
  journal= {arXiv preprint arXiv:2305.04651},
  year   = {2023}
}

备注

https://yupeilin2388.github.io/publication/ReDiffuser