通过判别器自监督实现 GAN 的空间可操控性
计算机视觉与模式识别
2024-01-11 v2
摘要
生成模型近年来在逼真图像合成方面取得了巨大进展。为使人类能够引导图像生成过程并定制输出,许多工作探索了 GAN 中潜空间的可解释维度。现有方法通过沿特定方向改变潜码来编辑输出图像的朝向或配色方案等属性。然而,这些方法通常需要对每个预训练模型附加人工标注,且大多聚焦于编辑全局属性。在本工作中,我们提出一种自监督方法,无需在潜空间中搜索可操控方向或要求额外标注,即可改善 GAN 的空间可操控性。具体而言,我们设计随机采样的高斯热图,将其作为空间归纳偏置编码进生成模型的中间层。在与 GAN 模型从头训练的同时,这些热图以自监督学习的方式与 GAN 判别器涌现的注意力相对齐。推理时,用户可直观地与空间热图交互,通过调整场景布局、移动或移除物体来编辑输出图像。此外,我们将 DragGAN 整合进我们的框架,其在合理时间内促进了细粒度操控并支持由粗到精的编辑过程。大量实验表明,所提方法不仅可对人脸、动物脸、室外场景及复杂的多物体室内场景进行空间编辑,还带来了合成质量的提升。代码、模型与演示视频见 https://genforce.github.io/SpatialGAN/。
引用
@article{arxiv.2301.08455,
title = {Spatial Steerability of GANs via Self-Supervision from Discriminator},
author = {Jianyuan Wang and Lalit Bhagat and Ceyuan Yang and Yinghao Xu and Yujun Shen and Hongdong Li and Bolei Zhou},
journal= {arXiv preprint arXiv:2301.08455},
year = {2024}
}
备注
This manuscript is a journal extension of our previous conference work (arXiv:2112.00718), submitted to TPAMI