用于 StyleGAN 图像布局编辑的用户可控隐空间变换器
计算机视觉与模式识别
2022-08-29 v1 图形学
摘要
隐空间探索是一种发现可解释隐方向并操纵隐码以编辑生成对抗网络(GAN)所生成图像中各种属性的技术。然而,在先前工作中,空间控制局限于简单变换(如平移和旋转),且识别合适的隐方向并调整其参数是费力的。本文中,我们通过直接标注图像来解决编辑 StyleGAN 图像布局的问题。为此,我们提出了一个根据用户输入操纵隐码的交互式框架。在我们的框架中,用户标注 StyleGAN 图像中想要移动或不移动的位置,并通过鼠标拖拽指定移动方向。从这些用户输入和初始隐码出发,我们基于 transformer 编码器-解码器架构的隐变换器估计输出隐码,将其输入 StyleGAN 生成器以获得结果图像。为训练我们的隐变换器,我们利用由现成 StyleGAN 和光流模型生成的合成数据与伪用户输入,无需人工监督。定量与定性评估证明了我们的方法相对于现有方法的有效性。
引用
@article{arxiv.2208.12408,
title = {User-Controllable Latent Transformer for StyleGAN Image Layout Editing},
author = {Yuki Endo},
journal= {arXiv preprint arXiv:2208.12408},
year = {2022}
}
备注
Accepted to Pacific Graphics 2022, project page: http://www.cgg.cs.tsukuba.ac.jp/~endo/projects/UserControllableLT