DF-GAN:一种简洁有效的文本到图像合成基线
计算机视觉与模式识别
2022-10-18 v4
摘要
从文本描述合成高质量逼真图像是一项具有挑战性的任务。现有的文本到图像生成对抗网络通常采用堆叠架构作为主干,但仍存在三个缺陷。首先,堆叠架构引入了不同图像尺度生成器之间的纠缠。其次,现有研究倾向于在对抗学习中应用并固定额外网络以保证文本-图像语义一致性,这限制了这些网络的监督能力。第三,先前工作广泛采用的基于跨模态注意力的文本-图像融合由于计算成本仅局限于若干特定图像尺度。为此,我们提出了一种更简洁但更有效的深度融合生成对抗网络(DF-GAN)。具体而言,我们提出:(i) 一种新颖的单阶段文本到图像主干,可直接合成高分辨率图像而避免不同生成器间的纠缠;(ii) 一种由匹配感知梯度惩罚与单向输出组成的新颖目标感知判别器,在不引入额外网络的情况下增强文本-图像语义一致性;(iii) 一种新颖的深度文本-图像融合模块,深化融合过程以实现文本与视觉特征之间的充分融合。与当前最先进方法相比,我们提出的 DF-GAN 更简洁且更高效地合成逼真且文本匹配的图像,并在广泛使用的数据集上取得更好性能。
引用
@article{arxiv.2008.05865,
title = {DF-GAN: A Simple and Effective Baseline for Text-to-Image Synthesis},
author = {Ming Tao and Hao Tang and Fei Wu and Xiao-Yuan Jing and Bing-Kun Bao and Changsheng Xu},
journal= {arXiv preprint arXiv:2008.05865},
year = {2022}
}