CPGAN:用于文本到图像合成的全谱内容解析生成对抗网络
计算机视觉与模式识别
2020-07-14 v2
摘要
典型的文本到图像合成方法力求设计有效的生成架构以直接建模文本到图像的映射。由于跨模态翻译,这是相当艰巨的。在本文中,我们规避该问题,通过彻底解析输入文本与合成图像的内容来在语义层面建模文本到图像的一致性。特别地,我们设计了一种记忆结构,在文本编码期间通过探索词汇表中每个词与相关图像中各种视觉语境之间的语义对应来解析文本内容。同时,合成图像被解析以对象感知的方式学习其语义。此外,我们定制了一个条件判别器来建模词与图像子区域之间的细粒度关联,以推动文本-图像语义对齐。在 COCO 数据集上的大量实验表明,我们的模型显著提升了最先进性能(Inception Score 从 35.69 提升至 52.73)。
引用
@article{arxiv.1912.08562,
title = {CPGAN: Full-Spectrum Content-Parsing Generative Adversarial Networks for Text-to-Image Synthesis},
author = {Jiadong Liang and Wenjie Pei and Feng Lu},
journal= {arXiv preprint arXiv:1912.08562},
year = {2020}
}
备注
18 pages,8 figures