通过对抗训练实现对象驱动的文本到图像合成
计算机视觉与模式识别
2019-03-01 v1
摘要
在本文中,我们提出对象驱动的注意力生成对抗网络(Obj-GANs),其允许针对复杂场景的以对象为中心文本到图像合成。遵循两步(布局-图像)生成过程,提出一种新颖的对象驱动注意力图像生成器,通过关注文本描述中最相关的词和预生成的语义布局来合成显著对象。此外,提出一种基于 Fast R-CNN 的新对象级判别器,以提供关于合成对象是否匹配文本描述和预生成布局的丰富对象级判别信号。所提出的 Obj-GAN 在大规模 COCO 基准上以各种指标显著优于先前的最先进水平,将 Inception 分数提高 27%,并将 FID 分数降低 11%。通过分析了传统网格注意力与新型对象驱动注意力的机制并可视化其注意力层,提供了两者间的详尽比较,展示了所提模型如何高质量生成复杂场景的洞见。
引用
@article{arxiv.1902.10740,
title = {Object-driven Text-to-Image Synthesis via Adversarial Training},
author = {Wenbo Li and Pengchuan Zhang and Lei Zhang and Qiuyuan Huang and Xiaodong He and Siwei Lyu and Jianfeng Gao},
journal= {arXiv preprint arXiv:1902.10740},
year = {2019}
}
备注
CVPR 2019