中文

关于混叠缩放与 GAN 评估中令人惊讶的细微之处

计算机视觉与模式识别 2022-01-24 v3 图形学 机器学习

摘要

评估生成模型的指标旨在度量真实图像与生成图像之间的差异。例如常用的 Frechet Inception Distance (FID) 指标,利用深度网络从两组图像中提取“高层”特征。然而,我们发现“低层”预处理(具体为图像缩放与压缩)中的差异会引起巨大变化并产生未预见后果。例如,缩放图像时(如采用双线性或双三次核),信号处理原理要求根据下采样因子调整预滤波宽度,以抗混叠至适当带宽。但常用实现使用固定宽度预滤波,导致混叠伪影。此类混叠会造成下游特征提取的损坏。其次,有损压缩(如 JPEG)常用于减小图像文件大小。尽管其设计为使图像感知质量退化最小,该操作也会在下游产生变化。此外,我们表明若对真实训练图像使用压缩,则若生成图像也随后被压缩,FID 实际上会改善。本文表明低层图像处理的选择一直是生成建模中被低估的方面。我们识别并刻画生成建模开发流程中的变化,基于信号处理原理给出建议,并发布参考实现以促进未来比较。

关键词

引用

@article{arxiv.2104.11222,
  title  = {On Aliased Resizing and Surprising Subtleties in GAN Evaluation},
  author = {Gaurav Parmar and Richard Zhang and Jun-Yan Zhu},
  journal= {arXiv preprint arXiv:2104.11222},
  year   = {2022}
}

备注

GitHub: https://www.github.com/GaParmar/clean-fid Website: https://www.cs.cmu.edu/~clean-fid/