用于文本到图像生成的循环仿射变换
计算机视觉与模式识别
2022-04-25 v1
摘要
文本到图像生成旨在根据文本描述生成自然图像。该任务的主要难点在于将文本信息有效地融合到图像生成过程中。现有方法通常利用多个孤立的融合模块(如条件批归一化和实例归一化)自适应地将合适的文本信息融合到生成过程中。然而,孤立的融合模块不仅相互冲突,还增加了训练难度(见补充材料第一页)。为解决这些问题,我们提出了一种用于生成对抗网络(GAN)的循环仿射变换(RAT),其通过循环神经网络连接所有融合模块以建模它们的长期依赖关系。此外,为提高文本与生成图像之间的语义一致性,我们在判别器中引入了空间注意力模型。通过感知匹配的图像区域,文本描述监督生成器合成更相关的图像内容。在 CUB、Oxford-102 和 COCO 数据集上的大量实验证明了所提模型相较于最先进模型的优越性。
引用
@article{arxiv.2204.10482,
title = {Recurrent Affine Transformation for Text-to-image Synthesis},
author = {Senmao Ye and Fei Liu and Minkui Tan},
journal= {arXiv preprint arXiv:2204.10482},
year = {2022}
}