中文

not-so-BigGAN:基于小波超分辨率在小计算量上生成高保真图像

图像与视频处理 2020-10-27 v2 计算机视觉与模式识别 机器学习

摘要

用于高分辨率图像生成的顶尖模型,如 BigGAN 与 VQVAE-2,需要惊人的计算资源与/或时间(512 个 TPU-v3 核心)来训练,使广大研究群体难以企及。另一方面,基于 GAN 的图像超分辨率模型,如 ESRGAN,不仅能将图像上采样至高维,且训练高效。本文中,我们提出 not-so-big-GAN(nsb-GAN),一种简单而高性价比的两步训练框架,用于高维自然图像的深度生成模型(DGMs)。首先,我们在小波域中训练采样器以生成低频带图像。随后,我们用新颖的小波超分辨率解码器网络将这些图像从小波域超分辨率回像素空间。基于小波的下采样方法比基于像素的方法保留更多结构信息,从而显著提升低分辨率采样器(如 64x64)的生成质量。由于采样器与解码器可并行训练且作用于比端到端模型低得多的维度空间,训练代价大幅降低。在 ImageNet 512x512 上,我们的模型以一半计算量(256 个 TPU-v3 核心)取得了 10.59 的 Fréchet Inception Distance(FID),优于基线 BigGAN 模型。

关键词

引用

@article{arxiv.2009.04433,
  title  = {not-so-BigGAN: Generating High-Fidelity Images on Small Compute with Wavelet-based Super-Resolution},
  author = {Seungwook Han and Akash Srivastava and Cole Hurwitz and Prasanna Sattigeri and David D. Cox},
  journal= {arXiv preprint arXiv:2009.04433},
  year   = {2020}
}