基于双重池化生成对抗网络的图像布局到图像翻译
计算机视觉与模式识别
2021-10-04 v1
摘要
本文中,我们处理图像布局到图像翻译任务,其旨在将输入的语义布局翻译为真实图像。现有方法中广泛观察到的一个开放挑战是在图像翻译过程中缺乏有效的语义约束,导致模型无法保留语义信息并忽略同一对象内的语义依赖。为解决此问题,我们提出了一种新颖的双重池化 GAN (DPGAN),用于从输入布局生成照片级真实且语义一致的结果。我们还提出了一种新颖的双重池化模块(DPM),其由方形池化模块(SPM)和矩形池化模块(RPM)组成。具体而言,SPM 旨在以不同空间尺度捕获输入布局的短程语义依赖,而 RPM 旨在从水平和垂直两个方向捕获长程语义依赖。我们随后有效融合 SPM 和 RPM 的输出,以进一步增大生成器的感受野。在五个流行数据集上的大量实验表明,所提出的 DPGAN 取得了优于最先进方法的结果。最后,SPM 和 RPM 均具有通用性,可无缝集成到任何基于 GAN 的架构中以增强特征表示。代码见 https://github.com/Ha0Tang/DPGAN。
引用
@article{arxiv.2108.12900,
title = {Layout-to-Image Translation with Double Pooling Generative Adversarial Networks},
author = {Hao Tang and Nicu Sebe},
journal= {arXiv preprint arXiv:2108.12900},
year = {2021}
}
备注
Accepted to TIP