用于语义图像合成的对偶注意力 GAN
计算机视觉与模式识别
2020-09-01 v1 人工智能
机器学习
多媒体
摘要
本文关注语义图像合成任务,旨在将语义标签图转换为照片级真实图像。现有方法缺乏有效的语义约束以保留语义信息,且忽略空间与通道维度上的结构关联,导致结果模糊且易产生伪影。为克服这些局限,我们提出一种新颖的对偶注意力 GAN (DAGAN),从输入布局合成具精细细节的照片级真实且语义一致的图像,而不引入额外训练开销或修改现有方法的网络架构。我们还提出两个新颖模块,即位置级空间注意力模块(SAM)与尺度级通道注意力模块(CAM),分别捕捉空间与通道维度上的语义结构注意力。具体而言,SAM 通过空间注意力图选择性关联各位置的像素,使得具有相同语义标签的像素无论空间距离如何均相互关联。同时,CAM 通过通道注意力图选择性强调各通道的尺度级特征,其整合所有通道图中关联的跨尺度特征。我们最终将 SAM 与 CAM 的输出相加以进一步改善特征表示。在四个具挑战性数据集上的大量实验表明,DAGAN 以更少模型参数取得了显著优于最先进方法的结果。源代码与训练模型可见于 https://github.com/Ha0Tang/DAGAN。
引用
@article{arxiv.2008.13024,
title = {Dual Attention GANs for Semantic Image Synthesis},
author = {Hao Tang and Song Bai and Nicu Sebe},
journal= {arXiv preprint arXiv:2008.13024},
year = {2020}
}
备注
Accepted to ACM MM 2020, camera ready (9 pages) + supplementary (10 pages)