中文

用于域适应的可逆自编码器

图像与视频处理 2018-02-21 v1 计算机视觉与模式识别

摘要

无监督图像到图像翻译旨在寻找源图像域(AA)与目标图像域(BB)之间的映射,在许多应用中训练时无法获得对齐的图像对。这是一个不适定的学习问题,因为它需要从边缘分布推断联合概率分布。最先进的方法(如 CycleGAN [Zhu et al., 2017])通常通过联合学习耦合映射 FAB:ABF_{AB}: A \rightarrow BFBA:BAF_{BA}: B \rightarrow A 来学习该翻译,其做法是在学习问题中引入循环一致性要求,即 FAB(FBA(B))BF_{AB}(F_{BA}(B)) \approx BFBA(FAB(A))AF_{BA}(F_{AB}(A)) \approx A。循环一致性强制保留输入图像与翻译图像之间的互信息。然而,它并未显式地强制 FBAF_{BA}FABF_{AB} 的逆操作。我们提出了一种称为可逆自编码器(InvAuto)的新深度架构,以显式地强制这一关系。这是通过强制编码器成为解码器的逆版本来实现的,其中对应层执行相反的映射并共享参数。这些映射被约束为正交归一。所得架构减少了可训练参数的数量(最多达 22 倍)。我们在基准数据集上展示了图像翻译结果,并证明了我们方法的最先进性能。最后,我们在道路视频转换任务上测试了所提出的域适应方法。我们证明使用 InvAuto 转换的视频具有高质量,并表明在真实道路视频上训练的、被称为 PilotNet 的 NVIDIA 基于神经网络的自自动驾驶端到端学习系统,在转换后的视频上测试时表现良好。

关键词

引用

@article{arxiv.1802.06869,
  title  = {Invertible Autoencoder for domain adaptation},
  author = {Yunfei Teng and Anna Choromanska and Mariusz Bojarski},
  journal= {arXiv preprint arXiv:1802.06869},
  year   = {2018}
}