中文

用于共享跨域特征表示与图像到图像翻译的自编码方法

计算机视觉与模式识别 2020-06-23 v1 机器学习 图像与视频处理 机器学习

摘要

图像到图像翻译是计算机视觉与模式识别问题的一个子集,其目标是学习域 X1\mathbf{X}_1 的输入图像与域 X2\mathbf{X}_2 的输出图像之间的映射。当前方法使用具有编码器-解码器结构的神经网络来学习映射 G:X1X2G:\mathbf{X}_1 \to\mathbf{X}_2,使得来自 X2\mathbf{X}_2 的图像分布与 G(X1)G(\mathbf{X}_1) 的分布相同,其中 G(X1)=dG(fG(X1))G(\mathbf{X}_1) = d_G (f_G (\mathbf{X}_1)),且 fG()f_G (\cdot) 称为编码器,dG()d_G(\cdot) 称为解码器。目前,此类同时计算逆映射 F:X2X1F:\mathbf{X}_2 \to \mathbf{X}_1 的方法使用单独的编码器-解码器对 dF(fF(X2))d_F (f_F (\mathbf{X}_2)) 或至少使用单独的解码器 dF()d_F (\cdot) 来实现。本文引入一种使用单一编码器-解码器架构执行跨多域的跨域图像到图像翻译的方法。我们使用一个自编码网络,给定输入图像 X1\mathbf{X}_1,首先计算潜在域编码 Zd=fd(X1)Z_d = f_d (\mathbf{X}_1) 与潜在内容编码 Zc=fc(X1)Z_c = f_c (\mathbf{X}_1),其中域编码 ZdZ_d 与内容编码 ZcZ_c 相互独立。随后解码器网络 g(Zd,Zc)g(Z_d,Z_c) 重建原始图像 X^1=g(Zd,Zc)X1\mathbf{\widehat{X}}_1=g(Z_d,Z_c )\approx \mathbf{X}_1。理想情况下,域编码 ZdZ_d 不包含图像内容的任何信息,内容编码 ZcZ_c 不包含图像域的任何信息。我们利用编码的这一特性,通过简单改变解码器输入的域编码 ZdZ_d 来寻找跨域映射 G:XYG: X\to YG(X1)=d(fd(x2i),fc(X1))G(\mathbf{X}_1 )=d(f_d (\mathbf{x}_2^i ),f_c (\mathbf{X}_1)),其中 x2i\mathbf{x}_2^iX2\mathbf{X}_2 的第 ii 个观测。

关键词

引用

@article{arxiv.2006.11404,
  title  = {Auto-Encoding for Shared Cross Domain Feature Representation and Image-to-Image Translation},
  author = {Safalya Pal},
  journal= {arXiv preprint arXiv:2006.11404},
  year   = {2020}
}