中文

用于非配对图像到图像翻译的全局与局部对齐网络

计算机视觉与模式识别 2021-11-22 v1

摘要

非配对图像到图像翻译的目标是生成一幅反映目标域风格、同时保持输入源图像中无关内容不变的输出图像。然而,由于现有方法缺乏对内容变化的关注,源图像的语义信息在翻译过程中发生退化。本文中,为解决这个问题,我们提出一种新方法——全局与局部对齐网络(Global and Local Alignment Networks, GLA-Net)。全局对齐网络旨在将输入图像从源域迁移到目标域。为有效实现这一点,我们使用基于 MLP-Mixer 的风格编码器学习多元高斯分布的参数(均值与标准差)作为风格特征。为更准确地迁移风格,我们在编码器中采用自适应实例归一化层,以目标多元高斯分布的参数作为输入。我们还采用正则化损失与似然损失来进一步缩小域差距并生成高质量输出。此外,我们引入一个局部对齐网络,其利用预训练的自监督模型通过一种新颖的局部对齐损失生成注意力图,确保翻译网络聚焦于相关像素。在五个公开数据集上的大量实验表明,我们的方法比现有方法更有效地生成更清晰、更真实的图像。我们的代码见 https://github.com/ygjwd12345/GLANet。

关键词

引用

@article{arxiv.2111.10346,
  title  = {Global and Local Alignment Networks for Unpaired Image-to-Image Translation},
  author = {Guanglei Yang and Hao Tang and Humphrey Shi and Mingli Ding and Nicu Sebe and Radu Timofte and Luc Van Gool and Elisa Ricci},
  journal= {arXiv preprint arXiv:2111.10346},
  year   = {2021}
}