论生成模型的频率偏置
计算机视觉与模式识别
2021-11-05 v1
摘要
生成对抗网络(GANs)的关键目标是生成与所提供的训练数据具有相同统计特性的新数据。然而,多项近期研究表明,最先进的架构仍难以实现这一目标。具体而言,它们报告了频谱统计中高频成分过多,这使得区分真实图像与生成图像变得轻而易举。对于这一现象的解释存在争议:大多数工作将伪影归因于生成器,而其他工作则指向判别器。我们冷静审视这些解释,并就所提出的针对高频伪影的缓解措施为何有效提供见解。为此,我们首先独立评估生成器与判别器的架构,并探究它们是否表现出一种频率偏置,使得学习高频内容的分布尤为困难。基于这些实验,我们得出以下四点观察:1)不同的上采样操作使生成器偏向不同的频谱特性。2)由上采样引入的棋盘格伪影本身无法解释频谱差异,因为生成器能够补偿这些伪影。3)判别器本身并非难以检测高频,而是难以处理低幅值的频率。4)判别器中的下采样操作会损害其提供的训练信号的质量。鉴于这些发现,我们分析了最先进 GAN 训练中针对高频伪影的缓解措施,但发现现有方法均无法完全消除频谱伪影。我们的结果表明,改进判别器具有巨大潜力,而这可能是更紧密匹配训练数据分布的关键。
引用
@article{arxiv.2111.02447,
title = {On the Frequency Bias of Generative Models},
author = {Katja Schwarz and Yiyi Liao and Andreas Geiger},
journal= {arXiv preprint arXiv:2111.02447},
year = {2021}
}