中文

在多属性图像到图像翻译中弥合基于标签与基于参考合成之间的鸿沟

计算机视觉与模式识别 2021-10-12 v1 人工智能

摘要

图像到图像翻译(I2IT)模型以目标标签或参考图像为输入,将源图像变换至指定目标域。基于标签与基于参考的两种合成存在显著差异。特别地,基于标签的合成反映目标域的共性特征,而基于参考的合成展现与参考相似的特定风格。本文旨在多属性 I2IT 任务中弥合二者间的鸿沟。我们设计了基于标签与基于参考的编码模块(LEM 与 REM)以比较域差异。它们首先通过属性差异向量提供相反方向,将源图像与目标标签(或参考)转入一公共嵌入空间。随后将两种嵌入简单融合形成潜码 S_rand(或 S_ref),反映域风格差异,并通过 SPADE 注入生成器各层。为联结 LEM 与 REM 使两类结果互为裨益,我们促使两种潜码相近,并在其正向与反向翻译间建立循环一致性。此外,S_rand 与 S_ref 间的插值亦用于合成额外图像。实验表明,基于标签与基于参考的合成确实相互促进,从而我们既能从 LEM 获得多样化结果,也能从参考相似风格获得高质量结果。

关键词

引用

@article{arxiv.2110.05055,
  title  = {Bridging the Gap between Label- and Reference-based Synthesis in Multi-attribute Image-to-Image Translation},
  author = {Qiusheng Huang and Zhilin Zheng and Xueqi Hu and Li Sun and Qingli Li},
  journal= {arXiv preprint arXiv:2110.05055},
  year   = {2021}
}

备注

accepted by ICCV 2021