利用对比学习改进文本到图像合成
机器学习
2021-11-30 v2
摘要
文本到图像合成的目标是生成与给定文本描述在视觉上真实匹配的图像。在实践中,人类为同一图像标注的描述在内容和用词上存在较大差异。相同图像的描述之间的语言差异导致合成图像偏离真实图像。为解决此问题,我们提出一种对比学习方法来提高合成图像的质量并增强其语义一致性。在预训练阶段,我们利用对比学习方法来学习对应于同一图像的描述的一致文本表示。此外,在随后的GAN训练阶段,我们采用对比学习方法来增强由同一图像相关描述生成的图像之间的一致性。我们在CUB和COCO数据集上分别基于AttnGAN和DM-GAN两个流行的文本到图像合成模型评估了我们的方法。实验结果表明,我们的方法在IS、FID和R-precision三个指标上能有效提升合成图像的质量。特别是在具有挑战性的COCO数据集上,我们的方法相比AttnGAN将FID显著提升了29.60%,相比DM-GAN提升了21.96%。
引用
@article{arxiv.2107.02423,
title = {Improving Text-to-Image Synthesis Using Contrastive Learning},
author = {Hui Ye and Xiulong Yang and Martin Takac and Rajshekhar Sunderraman and Shihao Ji},
journal= {arXiv preprint arXiv:2107.02423},
year = {2021}
}
备注
Accepted to BMVC 2021