中文

可控文本到图像生成

计算机视觉与模式识别 2019-12-20 v2 计算与语言 机器学习

摘要

本文提出一种新颖的可控文本到图像生成对抗网络(ControlGAN),其能有效合成高质量图像,并根据自然语言描述控制图像生成的部分内容。为此,我们引入一个词级空间与通道注意力驱动的生成器,可解耦不同视觉属性,并使模型专注于生成和操作与最相关词对应的子区域。同时,提出词级判别器,通过将词与图像区域关联提供细粒度监督反馈,有助于训练出能有效操控特定视觉属性而不影响其他内容生成的生成器。此外,采用感知损失以降低图像生成中的随机性,并促使生成器操控修改后文本所需的特定属性。在基准数据集上的大量实验表明,我们的方法优于现有最先进水平,并能够利用自然语言描述有效操控合成图像。代码见 https://github.com/mrlibw/ControlGAN。

关键词

引用

@article{arxiv.1909.07083,
  title  = {Controllable Text-to-Image Generation},
  author = {Bowen Li and Xiaojuan Qi and Thomas Lukasiewicz and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:1909.07083},
  year   = {2019}
}

备注

NeurIPS 2019