中文

渐进式文本到图像生成

计算机视觉与模式识别 2023-09-21 v5

摘要

近来,向量量化自回归(VQ-AR)模型在文本到图像合成中展现出显著成果,其通过在潜空间从左上到右下等概率预测离散图像令牌实现。尽管这一简单生成过程出奇地有效,但这是生成图像的最佳方式吗?例如,人类创作更倾向于图像的轮廓到细节,而 VQ-AR 模型本身未考虑图像块的任何相对重要性。在本文中,我们提出一种用于高保真文本到图像生成的渐进式模型。所提方法基于已有上下文以并行方式从粗到细创建新图像令牌而生效,且该过程通过所提误差修正机制递归应用,直至图像序列完成。所得的由粗到细层次使图像生成过程直观且可解释。MS COCO 基准上的大量实验表明,渐进式模型在 FID 分数上相较先前 VQ-AR 方法在广泛类别与方面均产生显著更优结果。此外,每步并行生成的设计带来了超过 ×13\times 13 的推理加速且性能损失轻微。

关键词

引用

@article{arxiv.2210.02291,
  title  = {Progressive Text-to-Image Generation},
  author = {Zhengcong Fei and Mingyuan Fan and Li Zhu and Junshi Huang},
  journal= {arXiv preprint arXiv:2210.02291},
  year   = {2023}
}

备注

Technique report