用于交互式图像合成与编辑的 Anycost GAN
计算机视觉与模式识别
2021-03-05 v1
摘要
生成对抗网络(GANs)已实现逼真图像的合成与编辑。然而,由于大规模生成器(如 StyleGAN2)的计算成本高昂,在边缘设备上单次编辑通常需数秒才能看到结果,阻碍了交互式用户体验。本文受现代渲染软件启发,提出 Anycost GAN 用于交互式自然图像编辑。我们训练 Anycost GAN 以支持弹性分辨率与通道数,从而以多变速度更快地生成图像。运行完整生成器的子集所产生的输出在感知上与完整生成器相似,使其成为良好的预览代理。通过采用基于采样的多分辨率训练、自适应通道训练以及生成器条件判别器,该任意成本生成器可在多种配置下评估,同时相比分别训练的模型获得更优图像质量。此外,我们开发了新型编码器训练与潜码优化技术,以在图像投影过程中确保不同子生成器间的一致性。Anycost GAN 可在多种成本预算下执行(最高减少 10 倍计算量)并适应广泛的硬件与延迟需求。当部署于桌面 CPU 与边缘设备时,我们的模型能以 6–12 倍加速提供感知相似的预览,实现交互式图像编辑。代码与演示公开可用:https://github.com/mit-han-lab/anycost-gan。
引用
@article{arxiv.2103.03243,
title = {Anycost GANs for Interactive Image Synthesis and Editing},
author = {Ji Lin and Richard Zhang and Frieder Ganz and Song Han and Jun-Yan Zhu},
journal= {arXiv preprint arXiv:2103.03243},
year = {2021}
}
备注
Accepted to CVPR 2021. The code and demo are available: https://github.com/mit-han-lab/anycost-gan