基于结构化文本且考虑视觉关系的图像生成
计算机视觉与模式识别
2020-07-21 v3
摘要
我们提出了一种由视觉关系布局模块和 GAN 金字塔(即 stacking-GANs)组成的端到端网络,用于根据给定结构化文本生成图像。我们的视觉关系布局模块以两种方式利用结构化文本中实体间的关系:综合使用和单独使用。我们综合使用所有可用关系来定位所有实体的初始边界框。我们还单独使用各个关系,从初始边界框预测输入文本中所有关系的关系统元。然后我们统一所有关系统元以产生视觉关系布局,即所有实体的边界框,使得每个边界框唯一对应于每个实体并保持其涉及的关系。我们的视觉关系布局反映了输入文本中给出的场景结构。stacking-GANs 是三个 GAN 的堆叠,以视觉关系布局和前一个 GAN 的输出为条件,一致地捕获场景结构。我们的网络在高分辨率下真实渲染实体细节同时保持场景结构。在两个公开数据集上的实验结果表明我们的方法优于最先进的方法。
引用
@article{arxiv.1908.01741,
title = {Visual-Relation Conscious Image Generation from Structured-Text},
author = {Duc Minh Vo and Akihiro Sugimoto},
journal= {arXiv preprint arXiv:1908.01741},
year = {2020}
}
备注
accepted at ECCV 2020