基于 Token-Critic 改进的掩码图像生成
计算机视觉与模式识别
2022-09-12 v1
摘要
非自回归生成式 transformer 近期展示了令人印象深刻的图像生成性能,以及比自回归对应模型快几个数量级的采样速度。然而,从视觉 token 的真实联合分布中进行最优并行采样仍是一个开放挑战。在本文中,我们引入 Token-Critic,一种用于引导非自回归生成式 transformer 采样的辅助模型。给定一张掩码并重建的真实图像,Token-Critic 模型被训练来区分哪些视觉 token 属于原始图像,哪些由生成式 transformer 采样得到。在非自回归迭代采样期间,Token-Critic 用于选择接受哪些 token 以及拒绝并重采样哪些 token。结合 Token-Critic,最先进的生成式 transformer 显著提升了其性能,并在具有挑战性的类条件 ImageNet 生成中,在生成图像质量与多样性的权衡方面优于近期的扩散模型和 GAN。
引用
@article{arxiv.2209.04439,
title = {Improved Masked Image Generation with Token-Critic},
author = {José Lezama and Huiwen Chang and Lu Jiang and Irfan Essa},
journal= {arXiv preprint arXiv:2209.04439},
year = {2022}
}
备注
Accepted to ECCV 2022