中文

生成对抗网络中用于图像生成的空间隐表示

计算机视觉与模式识别 2023-03-28 v1 图像与视频处理

摘要

在大多数 GAN 架构中,隐空间被定义为给定维度的向量集合。此类表示不易解释,且不能直接捕获图像内容的空间信息。在本工作中,我们为 StyleGAN2 定义了一系列空间隐空间,能够捕获更多细节并表示在对象部件的数量和排列上超出样本的图像,例如多张脸的图像或具有多于两只眼睛的脸。我们提出了一种将图像编码到我们的空间的方法,以及能够在这些空间中执行属性编辑的属性模型。我们展示了我们的空间对图像操控有效且能很好地编码语义信息。我们的方法可用于预训练的生成器模型,并且属性编辑可使用预生成的方向向量完成,使得实验和使用的入门门槛极低。我们提出了一种用于优化隐表示的正则化方法,其均衡隐空间各部分分布,使表示更接近生成表示。我们将其用于把图像编码到空间空间以获得质量显著提升,同时保持语义和使用我们属性模型进行编辑的能力。总体而言,使用我们的方法在 LPIPS 分数上相比标准方法给出高达 30% 的编码质量提升,同时保持语义。此外,我们提出了在我们的空间隐空间上的 StyleGAN2 训练过程,以及自定义的空间隐表示分布,使得表示中空间上更接近的元素比更远的元素彼此更依赖。该方法在 SpaceNet 上将 FID 分数提高了 29%,并能在空间同质数据集(如卫星图像)上生成任意大小的一致图像。

关键词

引用

@article{arxiv.2303.14552,
  title  = {Spatial Latent Representations in Generative Adversarial Networks for Image Generation},
  author = {Maciej Sypetkowski},
  journal= {arXiv preprint arXiv:2303.14552},
  year   = {2023}
}