中文

从保真到可编辑:利用连续图像反演 GAN

计算机视觉与模式识别 2021-08-16 v3

摘要

现有的 GAN 反演方法陷入了一种悖论:反演得到的编码要么实现高保真重建,要么保留编辑能力。仅具备其中之一显然无法实现真实图像编辑。本文通过将连续图像(例如视频帧或不同姿态的同一人)引入反演过程来解决这一悖论。我们方案背后的原理是,连续图像的连续性带来了固有的可编辑方向。这一先天特性被用于两个独特目的:1)正则化联合反演过程,使得每个反演编码在语义上可从其他编码之一访问,并固定于可编辑域内;2)强化图像间一致性,使得每个反演编码的保真度可借助其他图像的互补而最大化。大量实验表明,在真实图像数据集与合成数据集上,我们的方案在重建保真度与可编辑性方面均显著优于 SOTA 方法。此外,我们的方法首次支持基于视频的 GAN 反演,并给出了一个从连续图像进行无监督语义转移的趣味应用。源代码见:\url{https://github.com/cnnlstm/InvertingGANs_with_ConsecutiveImgs}。

关键词

引用

@article{arxiv.2107.13812,
  title  = {From Continuity to Editability: Inverting GANs with Consecutive Images},
  author = {Yangyang Xu and Yong Du and Wenpeng Xiao and Xuemiao Xu and Shengfeng He},
  journal= {arXiv preprint arXiv:2107.13812},
  year   = {2021}
}

备注

Paper has been accepted by ICCV