面向文本到图像生成的跨模态对比学习
计算机视觉与模式识别
2022-04-15 v5
摘要
文本到图像合成系统的输出应当是连贯、清晰、照片级真实的场景,并与所给定的条件文本描述具有高度语义保真度。我们的跨模态对比生成对抗网络(XMC-GAN)通过最大化图像与文本之间的互信息来应对这一挑战。它借助多个对比损失来实现这一点,这些损失捕捉模态间与模态内的对应关系。XMC-GAN 使用一种注意力自调制生成器,以强化文本-图像对应,并使用一个对比判别器,其既作为评判器,又作为对比学习的特征编码器。正如我们在三个具有挑战性的数据集上所展示的,XMC-GAN 的输出质量相较先前模型有显著提升。在 MS-COCO 上,XMC-GAN 不仅将 SOTA FID 从 24.70 提升至 9.33,而且——更为重要的是——相较于其他三个近期模型,人们在图像质量上以 77.3、在图像-文本对齐上以 74.1 的偏好度更青睐 XMC-GAN。XMC-GAN 还泛化到具有挑战性的 Localized Narratives 数据集(其含有更长、更细致的描述),将 SOTA FID 从 48.70 提升至 14.12。最后,我们在具有挑战性的 Open Images 数据上训练并评估 XMC-GAN,确立了 26.91 的强基准 FID 分数。
引用
@article{arxiv.2101.04702,
title = {Cross-Modal Contrastive Learning for Text-to-Image Generation},
author = {Han Zhang and Jing Yu Koh and Jason Baldridge and Honglak Lee and Yinfei Yang},
journal= {arXiv preprint arXiv:2101.04702},
year = {2022}
}
备注
CVPR 2021