IntereStyle:编码兴趣区域以实现鲁棒的 StyleGAN 反演
计算机视觉与模式识别
2022-11-16 v2 机器学习
摘要
近来,随着生成对抗网络(GANs)及相应编码器的发展,真实世界图像的操作已被高度精细化,这些编码器将真实世界图像嵌入潜空间。然而,由于失真与感知之间的权衡,设计 GAN 的编码器仍是一项挑战性任务。本文中,我们指出已有编码器试图不仅在兴趣区域(如人脸区域)上降低失真,也在非兴趣区域(如背景图案与障碍物)上降低失真。然而,真实世界图像中的多数非兴趣区域位于分布外(OOD),生成模型无法理想地重建它们。此外,我们通过实验发现,与兴趣区域重叠的非兴趣区域会破坏兴趣区域的原始特征,例如,与人脸区域重叠的麦克风被反演为白胡子。因此,在保持感知质量的同时降低整幅图像的失真非常困难。为克服这一权衡,我们提出一种简单而有效的编码器训练方案,称为 IntereStyle,其通过聚焦于兴趣区域来促进编码。IntereStyle 引导编码器解耦兴趣与非兴趣区域的编码。为此,我们迭代地过滤非兴趣区域的信息,以调控其负面影响。我们证明,与现有最先进编码器相比,IntereStyle 实现了更低的失真与更高的感知质量。特别地,我们的模型鲁棒地保留原始图像特征,展现出鲁棒的图像编辑与风格混合结果。评审后我们将发布代码与预训练模型。
引用
@article{arxiv.2209.10811,
title = {IntereStyle: Encoding an Interest Region for Robust StyleGAN Inversion},
author = {Seungjun Moon and Gyeong-Moon Park},
journal= {arXiv preprint arXiv:2209.10811},
year = {2022}
}