基于层次嵌套对抗网络的图像生成式文本到图像合成
计算机视觉与模式识别
2018-04-10 v2
摘要
本文提出一种新方法,以应对以语义图像描述为条件生成照片级图像的艰巨任务。我们的方法在网络层次内部引入伴随的层次嵌套对抗目标,以正则化中间层表示并辅助生成器训练捕捉复杂的图像统计特性。我们提出了一种可扩展的单流生成器架构,以更好地适配联合判别器并将生成图像推至高分辨率。我们采用多目的对抗损失,以鼓励更有效地利用图像与文本信息,从而同时改善语义一致性与图像保真度。此外,我们引入一种新的视觉-语义相似性度量来评估生成图像的语义一致性。通过在三个公开数据集上的大量实验验证,我们的方法在所有数据集上针对不同评估指标均显著改进了先前的最优水平(SOTA)。
引用
@article{arxiv.1802.09178,
title = {Photographic Text-to-Image Synthesis with a Hierarchically-nested Adversarial Network},
author = {Zizhao Zhang and Yuanpu Xie and Lin Yang},
journal= {arXiv preprint arXiv:1802.09178},
year = {2018}
}
备注
CVPR2018 Spotlight