中文

Masked Generative Image Transformer 的 PyTorch 复现

计算机视觉与模式识别 2023-10-24 v1

摘要

在本技术报告中,我们给出了使用 PyTorch 对 MaskGIT: Masked Generative Image Transformer 的复现。该方法利用掩码双向 transformer 架构,能够以仅少量步数(8~16 步)生成 512 x 512 分辨率的图像,即比自回归方法快约 64 倍。通过严谨的实验与优化,我们取得了与原始论文所述发现高度一致的结果。我们的复现达到了报告的 FID 7.32,并在 ImageNet 上以 512 x 512 分辨率、相似超参数下得到 7.59。此外,我们通过细微超参数调整改进了官方实现,取得了 7.26 的 FID。在 256 x 256 像素的较低分辨率下,我们的重新实现得分为 6.80,而原论文为 6.18。为促进对掩码生成模型的进一步研究并便于复现,我们已在 https://github.com/valeoai/MaskGIT-pytorch/ 公开发布代码与预训练权重。

关键词

引用

@article{arxiv.2310.14400,
  title  = {A Pytorch Reproduction of Masked Generative Image Transformer},
  author = {Victor Besnier and Mickael Chen},
  journal= {arXiv preprint arXiv:2310.14400},
  year   = {2023}
}