中文

RATLIP:基于循环仿射变换的生成对抗式 CLIP 文本到图像合成

计算机视觉与模式识别 2025-10-14 v2

摘要

合成高质量的照片写实图像并以文本描述为条件是非常具有挑战性的。生成对抗网络 (GAN),作为完成此任务的经典模型,经常 suffer from 文本与图像描述之间的一致性不足以及合成图像的丰富性不足。最近,已将条件仿射变换 (CAT) 如条件批量归一化和实例归一化应用于 GAN 的不同层以控制图像内容的合成。CAT 是一个多层感知器,基于相邻层之间的批量统计独立预测数据,而无法获取全局文本信息。为解决此问题,我们首先将 CAT 和循环神经网络 (RAT) 模型化,以确保不同层可访问全局信息。随后,我们在 RAT 之间引入洗牌注意力,以缓解循环神经网络中信息遗忘的特征。此外,我们的生成器和判别器都利用了强大的预训练模型 CLIP,它已被广泛用于通过学习潜在空间中文本与图像之间的多模态表示来建立文本与图像之间的关联。判别器利用 CLIP 理解复杂场景的能力,对生成图像的质量进行准确评估。在 CUB、Oxford 和 CelebA-tiny 数据集上进行了大量实验,以证明所提出模型优于当前最先进的模型。代码地址为 https://github.com/OxygenLu/RATLIP。

关键词

引用

@article{arxiv.2405.08114,
  title  = {RATLIP: Generative Adversarial CLIP Text-to-Image Synthesis Based on Recurrent Affine Transformations},
  author = {Chengde Lin and Xijun Lu and Guangxi Chen},
  journal= {arXiv preprint arXiv:2405.08114},
  year   = {2025}
}

备注

Accepted by 2024 IEEE International Conference on Systems, Man, and Cybernetics(SMC)