中文

生成包含多个连贯对象的高保真带标注图像

计算机视觉与模式识别 2021-07-19 v3

摘要

生成式模型的最新进展使得生成多样化高保真图像成为可能。特别是,布局到图像生成模型因能够生成包含不同对象的逼真复杂图像而受到广泛关注。这些模型通常以语义布局或文本描述为条件。然而,与自然图像不同,在生物医学成像和遥感等领域,提供辅助信息极其困难。在这项工作中,我们提出了一种多对象生成框架,能够在生成过程中无需显式要求对象的上下文信息即可合成包含多个对象的图像。基于向量量化变分自编码器(VQ-VAE)主干网络,我们的模型通过两个强大的自回归先验:PixelSNAIL 和 LayoutPixelSNAIL,学习保持图像内的空间连贯性以及对象与背景之间的语义连贯性。PixelSNAIL 学习 VQ-VAE 潜在编码的分布,而 LayoutPixelSNAIL 则专门用于学习对象的语义分布。我们方法的一个隐含优势是,生成的样本附带对象级标注。我们通过在 Multi-MNIST 和 CLEVR 数据集上的实验展示了该方法如何保持连贯性和保真度;从而超越了最先进的多对象生成方法。我们通过在医学成像数据集上的应用展示了该方法的有效性,其中我们表明,使用该方法生成的样本扩充训练集可以提高现有模型的性能。

关键词

引用

@article{arxiv.2006.12150,
  title  = {Generating Annotated High-Fidelity Images Containing Multiple Coherent Objects},
  author = {Bryan G. Cardenas and Devanshu Arya and Deepak K. Gupta},
  journal= {arXiv preprint arXiv:2006.12150},
  year   = {2021}
}

备注

21 pages, 5 tables, 21 figures