用于文本到图像合成的高效神经架构
机器学习
2020-04-27 v1 机器学习
摘要
文本到图像合成是从文本描述生成图像的任务。图像生成本身是一项具有挑战性的任务。当我们将图像生成与文本结合时,我们将复杂性提升到了一个新的层次:我们需要结合来自两种不同模态的数据。近期大多数文本到图像合成工作在神经架构上遵循相似的方法。由于上述困难,加上在高分辨率下训练 GAN 的固有难度,大多数方法采用了多阶段训练策略。在本文中,我们转变了当前文本到图像方法所使用的架构范式,并表明一个有效的神经架构可以通过使用单阶段训练、单一生成器和单一判别器来实现最先进的性能。我们通过应用深度残差网络以及一种新颖的句子插值策略来实现这一点,该策略能够学习平滑的条件空间。最后,我们的工作为文本到图像研究指出了一个新方向,该方向近期尚未尝试新颖的神经架构。
引用
@article{arxiv.2004.11437,
title = {Efficient Neural Architecture for Text-to-Image Synthesis},
author = {Douglas M. Souza and Jônatas Wehrmann and Duncan D. Ruiz},
journal= {arXiv preprint arXiv:2004.11437},
year = {2020}
}