DSE-GAN:用于文本到图像生成的动态语义演化生成对抗网络
计算机视觉与模式识别
2024-01-23 v1
摘要
文本到图像生成旨在生成与给定文本在语义上一致的逼真图像。以往工作主要采用多阶段架构,通过堆叠生成器-判别器对进行多次对抗训练,其中用于提供生成引导的文本语义在所有阶段保持静态。本文认为,每个阶段的文本特征应根据历史阶段的状态(即历史阶段的文本与图像特征)进行自适应重组,以在由粗到细的生成过程中提供多样化且准确的语义引导。因此我们提出一种新颖的动态语义演化 GAN(DSE-GAN),在一种新颖的单对抗多阶段架构下重组各阶段的文本特征。具体而言,我们设计了(1)动态语义演化(DSE)模块,其首先聚合历史图像特征以总结生成反馈,然后动态选择各阶段需重组的词语,并通过动态增强或抑制不同粒度子空间的语义对其进行重组。(2)单对抗多阶段架构(SAMA),其扩展了先前结构,消除了复杂的多次对抗训练需求,从而允许更多阶段的文本-图像交互,并最终促进 DSE 模块。我们进行了全面实验,表明 DSE-GAN 在两个广泛使用的基准 CUB-200 和 MSCOCO 上分别实现了 7.48% 和 37.8% 的相对 FID 提升。
引用
@article{arxiv.2209.01339,
title = {DSE-GAN: Dynamic Semantic Evolution Generative Adversarial Network for Text-to-Image Generation},
author = {Mengqi Huang and Zhendong Mao and Penghui Wang and Quan Wang and Yongdong Zhang},
journal= {arXiv preprint arXiv:2209.01339},
year = {2024}
}