使用条件 GAN 的跨视角图像合成
计算机视觉与模式识别
2018-03-30 v2
摘要
学习生成自然场景一直是计算机视觉中的一项挑战性任务。当生成以视角截然不同的图像为条件时,则更为费力。这主要是因为跨视角理解、对应和转换外观与语义信息并非易事。在本文中,我们尝试使用条件生成对抗网络(cGAN)解决跨视角图像合成这一新问题,即航拍到街景及其反向合成。提出了两种称为 Crossview Fork(X-Fork)和 Crossview Sequential(X-Seq)的新架构,用于生成分辨率为 64x64 和 256x256 像素的场景。X-Fork 架构具有单个判别器和单个生成器。生成器在目标视角中同时幻构图像及其语义分割。X-Seq 架构利用两个 cGAN。第一个生成目标图像,随后将其输入第二个 cGAN 以生成相应的语义分割图。来自第二个 cGAN 的反馈帮助第一个 cGAN 生成更清晰的图像。我们提出的两种架构都学习生成自然图像及其语义分割图。所提方法表明,与仅考虑场景视觉外观的传统图像到图像翻译方法相比,它们能够更好地捕捉并保持源视角和目标视角中物体的真实语义。广泛的定性和定量评估支持了我们的框架相对于两种最先进方法在跨截然不同视角自然场景生成中的有效性。
引用
@article{arxiv.1803.03396,
title = {Cross-View Image Synthesis using Conditional GANs},
author = {Krishna Regmi and Ali Borji},
journal= {arXiv preprint arXiv:1803.03396},
year = {2018}
}
备注
Accepted at CVPR 2018