中文

基于语义耦合 VQ 模型的语义图像合成

计算机视觉与模式识别 2022-09-07 v1 人工智能

摘要

语义图像合成通过允许对生成内容进行引导,实现对无条件图像生成的控制。我们有条件地从预训练用于自编码图像的向量量化模型(VQ-model)合成潜空间。我们发现,与在分别学习的条件潜变量和图像潜变量上训练自回归 Transformer 不同,联合学习条件潜变量和图像潜变量显著提升了 Transformer 模型的建模能力。虽然我们联合训练的 VQ 模型在语义和图像潜变量上都取得了与原始 VQ 模型相似的重建性能,但在自编码阶段将两种模态绑定被证明是提升自回归建模性能的重要要素。我们表明,在流行的语义图像数据集 ADE20k、Cityscapes 和 COCO-Stuff 上,我们的模型利用自回归模型改进了语义图像合成。

关键词

引用

@article{arxiv.2209.02536,
  title  = {Semantic Image Synthesis with Semantically Coupled VQ-Model},
  author = {Stephan Alaniz and Thomas Hummel and Zeynep Akata},
  journal= {arXiv preprint arXiv:2209.02536},
  year   = {2022}
}

备注

ICLR 2022 DGM4HSD