Masked Generative Image Transformer 的 PyTorch 复现
计算机视觉与模式识别
2023-10-24 v1
摘要
在本技术报告中,我们给出了使用 PyTorch 对 MaskGIT: Masked Generative Image Transformer 的复现。该方法利用掩码双向 transformer 架构,能够以仅少量步数(8~16 步)生成 512 x 512 分辨率的图像,即比自回归方法快约 64 倍。通过严谨的实验与优化,我们取得了与原始论文所述发现高度一致的结果。我们的复现达到了报告的 FID 7.32,并在 ImageNet 上以 512 x 512 分辨率、相似超参数下得到 7.59。此外,我们通过细微超参数调整改进了官方实现,取得了 7.26 的 FID。在 256 x 256 像素的较低分辨率下,我们的重新实现得分为 6.80,而原论文为 6.18。为促进对掩码生成模型的进一步研究并便于复现,我们已在 https://github.com/valeoai/MaskGIT-pytorch/ 公开发布代码与预训练权重。
引用
@article{arxiv.2310.14400,
title = {A Pytorch Reproduction of Masked Generative Image Transformer},
author = {Victor Besnier and Mickael Chen},
journal= {arXiv preprint arXiv:2310.14400},
year = {2023}
}