SAC-GAN:结构感知的图像合成
计算机视觉与模式识别
2022-12-05 v5
摘要
我们引入一种端到端学习框架用于图像到图像的合成,旨在将物体图像中以裁剪块表示的对象合理地合成到背景场景图像中。由于我们的方法更强调合成图像的语义与结构连贯性,而非其像素级 RGB 精度,我们用结构感知特征定制网络的输入与输出,并相应设计网络损失,通过物体裁剪以自监督方式建立真值。具体而言,我们的网络以输入场景图像的语义布局特征、输入对象块中边缘与轮廓编码的特征以及潜码作为输入,并生成定义对象块平移与缩放的二维空间仿射变换。学习到的参数进一步送入可微空间变换网络以将对象块变换到目标图像,其中我们的模型使用仿射变换判别器和布局判别器以对抗方式训练。我们评估了称为 SAC-GAN 的网络在质量、可合成性和合成图像泛化性方面的多种图像合成场景。与包括 Instance Insertion、ST-GAN、CompGAN 和 PlaceNet 在内的最先进替代方法进行比较,证实了我们的方法具有优越性。
引用
@article{arxiv.2112.06596,
title = {SAC-GAN: Structure-Aware Image Composition},
author = {Hang Zhou and Rui Ma and Ling-Xiao Zhang and Lin Gao and Ali Mahdavi-Amiri and Hao Zhang},
journal= {arXiv preprint arXiv:2112.06596},
year = {2022}
}
备注
Accepted to TVCG. Code: https://github.com/RyanHangZhou/SAC-GAN