用于跨视角图像翻译的级联交叉 MLP-Mixer GAN
计算机视觉与模式识别
2021-10-22 v1
摘要
以往的跨视角图像翻译方法直接采用简单的编码器-解码器或 U-Net 结构,难以很好地生成目标视角的图像,尤其是对于差异极大的视角和严重形变的情况。为缓解该问题,我们提出了一种新颖的两阶段框架,其第一阶段包含一个新的级联交叉 MLP-Mixer(CrossMLP)子网络,第二阶段包含一个精炼的像素级损失。在第一阶段,CrossMLP 子网络通过我们新颖的 CrossMLP 模块学习图像编码与语义图编码之间的潜在变换线索。随后在这些线索的指导下逐步生成粗粒度结果。此外,在第二阶段,我们设计了一种精炼的像素级损失,以更紧凑的方式通过更合理的正则化缓解噪声语义标签问题,从而实现更好的优化。在 Dayton~\cite{vo2016localizing} 和 CVUSA~\cite{workman2015wide} 数据集上的大量实验结果表明,我们的方法能生成显著优于当前最优(state-of-the-art)方法的结果。源代码和训练好的模型可在 https://github.com/Amazingren/CrossMLP 获取。
引用
@article{arxiv.2110.10183,
title = {Cascaded Cross MLP-Mixer GANs for Cross-View Image Translation},
author = {Bin Ren and Hao Tang and Nicu Sebe},
journal= {arXiv preprint arXiv:2110.10183},
year = {2021}
}
备注
16 pages, 5 figures