基于Transformer的从场景图生成图像
计算机视觉与模式识别
2023-03-09 v1
摘要
图结构的场景描述可高效用于生成模型以控制生成图像的构成。以往方法分别基于图卷积网络与对抗方法来进行布局预测与图像生成。本工作中,我们展示如何采用多头注意力编码图信息,以及在隐空间中使用基于Transformer的模型进行图像生成,从而提升采样数据质量,且无需使用对抗模型,从而在训练稳定性上带来后续优势。具体而言,所提方法完全基于Transformer架构,既用于将场景图编码为中间物体布局,也用于将这些布局解码为图像,其间通过向量量化变分自编码器学习的低维空间。我们的方法相较最先进方法提升了图像质量,且对同一场景图的多次生成具有更高多样性。我们在三个公开数据集上评估方法:Visual Genome、COCO与CLEVR。在COCO与Visual Genome上,我们分别取得13.7与12.8的Inception Score,以及52.3与60.3的FID。我们对各项贡献进行消融实验以评估各组件影响。代码见 https://github.com/perceivelab/trf-sg2im
引用
@article{arxiv.2303.04634,
title = {Transformer-based Image Generation from Scene Graphs},
author = {Renato Sortino and Simone Palazzo and Concetto Spampinato},
journal= {arXiv preprint arXiv:2303.04634},
year = {2023}
}