中文

DAE-GAN:用于文本到图像合成的动态方面感知GAN

计算机视觉与模式识别 2021-08-30 v1 多媒体

摘要

文本到图像合成是指从给定文本描述生成图像,其关键目标在于照片真实感与语义一致性。以往方法通常用句子嵌入生成初始图像,再用细粒度词嵌入进行细化。尽管取得了显著进展,文本中所包含的“方面”信息(例如红眼睛),即指代多个词而非描绘“某事物的特定部分或特征”的单个词,常被忽略,而这类信息对合成图像细节极有帮助。如何在文本到图像合成中更好地利用方面信息仍是一个未解决的挑战。为此,本文提出一种动态方面感知GAN(DAE-GAN),从句子级、词级和方面级等多粒度全面表示文本信息。此外,受人类学习行为启发,我们开发了新颖的方面感知动态重绘器(ADR)用于图像细化,其中交替使用注意力全局细化(AGR)模块与方面感知局部细化(ALR)模块。AGR利用词级嵌入全局增强先前生成的图像,而ALR从局部视角动态利用方面级嵌入细化图像细节。最后,设计了相应的匹配损失函数以确保不同层级的文本-图像语义一致性。在两个广受研究且公开可用的数据集(即CUB-200和COCO)上的大量实验证明了我们方法的优越性与合理性。

关键词

引用

@article{arxiv.2108.12141,
  title  = {DAE-GAN: Dynamic Aspect-aware GAN for Text-to-Image Synthesis},
  author = {Shulan Ruan and Yong Zhang and Kun Zhang and Yanbo Fan and Fan Tang and Qi Liu and Enhong Chen},
  journal= {arXiv preprint arXiv:2108.12141},
  year   = {2021}
}

备注

10 pages, 6 figures