中文

基于级联语义引导的多通道注意力选择GAN用于跨视角图像翻译

计算机视觉与模式识别 2019-04-18 v2 人工智能 机器学习 多媒体

摘要

跨视角图像翻译具有挑战性,因为它涉及视角差异巨大且形变严重的图像。本文提出一种名为多通道注意力选择GAN(SelectionGAN)的新方法,该方法基于场景图像和新的语义图,能够生成任意视角的自然场景图像。所提出的SelectionGAN显式利用语义信息,并由两个阶段组成。在第一阶段,条件图像和目标语义图被输入到一个循环语义引导生成网络中以产生初始粗结果。在第二阶段,我们使用多通道注意力选择机制对初始结果进行细化。此外,从注意力中自动学习的不确定性图被用于引导像素损失以实现更好的网络优化。在Dayton、CVUSA和Ego2Top数据集上的大量实验表明,我们的模型能够生成显著优于最先进方法的结果。源代码、数据和训练好的模型可在 https://github.com/Ha0Tang/SelectionGAN 获取。

关键词

引用

@article{arxiv.1904.06807,
  title  = {Multi-Channel Attention Selection GAN with Cascaded Semantic Guidance for Cross-View Image Translation},
  author = {Hao Tang and Dan Xu and Nicu Sebe and Yanzhi Wang and Jason J. Corso and Yan Yan},
  journal= {arXiv preprint arXiv:1904.06807},
  year   = {2019}
}

备注

20 pages, 16 figures, accepted to CVPR 2019 as an oral paper