Draft-and-Revise: 基于上下文RQ-Transformer的有效图像生成
计算机视觉与模式识别
2022-06-10 v1 机器学习
摘要
尽管自回归模型在图像生成上已取得有前景的结果,其单向生成过程阻碍了所得图像充分反映全局上下文。为解决该问题,我们提出了一种有效的图像生成框架 Draft-and-Revise 与上下文RQ-Transformer,以在生成过程中考虑全局上下文。作为广义VQ-VAE,RQ-VAE首先将高分辨率图像表示为离散码栈序列。在序列中的码栈被随机掩码后,上下文RQ-Transformer被训练为基于图像的未掩码上下文填补被掩码的码栈。然后,上下文RQ-Transformer使用我们的两阶段解码 Draft-and-Revise 生成图像,同时在生成过程中利用图像的全局上下文。具体而言,在草稿阶段,我们的模型首先专注于生成多样化的图像,尽管质量较低。接着,在修订阶段,模型在保留生成图像全局上下文的同时迭代提升图像质量。实验中,我们的方法在条件图像生成上取得了最先进的(state-of-the-art)结果。我们还验证了 Draft-and-Revise 解码能通过有效掌控图像生成中的质量-多样性权衡实现高性能。
引用
@article{arxiv.2206.04452,
title = {Draft-and-Revise: Effective Image Generation with Contextual RQ-Transformer},
author = {Doyup Lee and Chiheon Kim and Saehoon Kim and Minsu Cho and Wook-Shin Han},
journal= {arXiv preprint arXiv:2206.04452},
year = {2022}
}
备注
20 pages, 11 figures