中文

第三次就好?使用 StyleGAN3 进行图像与视频编辑

计算机视觉与模式识别 2022-02-01 v1

摘要

StyleGAN 可以说是最有趣且研究最充分的生成模型之一,在图像生成、反演和操控方面展现出令人印象深刻的性能。在这项工作中,我们探索了最近的 StyleGAN3 架构,将其与前代进行比较,并研究其独特的优势与缺点。特别地,我们证明了虽然 StyleGAN3 可以在未对齐数据上训练,但仍可使用对齐数据进行训练,而不妨碍生成未对齐图像的能力。接下来,我们对 StyleGAN3 不同潜空间解耦的分析表明,常用的 W/W+ 空间比其 StyleGAN2 对应空间更纠缠,这凸显了使用 StyleSpace 进行细粒度编辑的好处。在图像反演方面,我们观察到现有的基于编码器的技术在未对齐数据上训练时表现不佳。因此我们提出了一种仅在对齐数据上训练、但仍能反演未对齐图像的编码方案。最后,我们引入了一种新颖的视频反演与编辑工作流,利用微调的 StyleGAN3 生成器的能力来减少纹理粘连并扩展编辑视频的视场。

关键词

引用

@article{arxiv.2201.13433,
  title  = {Third Time's the Charm? Image and Video Editing with StyleGAN3},
  author = {Yuval Alaluf and Or Patashnik and Zongze Wu and Asif Zamir and Eli Shechtman and Dani Lischinski and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2201.13433},
  year   = {2022}
}

备注

Project page available at https://yuval-alaluf.github.io/stylegan3-editing/