中文

基于步展开去噪自编码器的百万像素图像生成

计算机视觉与模式识别 2022-06-27 v1 机器学习

摘要

生成式建模研究中的一个持续趋势是在提高采样分辨率的同时降低训练和采样的计算需求。我们旨在通过技术组合将这一趋势进一步推进——每个组件都代表了各自领域当前效率的巅峰。这些包括向量量化GAN(VQ-GAN),一种能够实现高水平有损(但感知上无显著差异)压缩的向量量化(VQ)模型;hourglass transformers,一种高度可扩展的自注意力模型;以及步展开去噪自编码器(SUNDAE),一种非自回归(NAR)文本生成模型。出乎意料的是,我们的方法揭示了原始hourglass transformers公式在应用于多维数据时的缺陷。鉴于此,我们提出了对重采样机制的改进,适用于任何将分层transformers应用于多维数据的任务。此外,我们展示了SUNDAE对长序列长度的可扩展性——比先前工作长四倍。我们提出的框架可扩展至高分辨率(1024×10241024 \times 1024)且训练迅速(2-4天)。关键在于,训练后的模型在消费级GPU(GTX 1080Ti)上约2秒内即可生成多样且逼真的百万像素样本。总体而言,该框架具有灵活性:支持任意数量的采样步数、逐样本自停止、自校正能力、条件生成,以及允许任意修复掩码的NAR公式。我们在FFHQ256上获得10.56的FID分数——以不到一半的采样步数接近原始VQ-GAN——并在仅100个采样步数下于FFHQ1024上获得21.85的FID分数。

关键词

引用

@article{arxiv.2206.12351,
  title  = {Megapixel Image Generation with Step-Unrolled Denoising Autoencoders},
  author = {Alex F. McKinney and Chris G. Willcocks},
  journal= {arXiv preprint arXiv:2206.12351},
  year   = {2022}
}

备注

17 pages + 9 appendix pages. 20 figures