基于生成对抗网络的文本到图像合成视觉-语言匹配
计算机视觉与模式识别
2022-08-23 v1
摘要
文本到图像合成旨在从特定文本描述生成照片级真实且语义一致的图像。现有模型合成的图像相较于对应图像与文本描述通常包含有限成分,这降低了图像质量与文本-视觉一致性。为解决该问题,我们提出一种用于文本到图像合成的新型视觉-语言匹配策略,称为 VLMGAN*,其引入双重视觉-语言匹配机制以增强图像质量与语义一致性。该双重视觉-语言匹配机制考虑了生成图像与对应文本描述之间的文本-视觉匹配,以及合成图像与真实图像之间的视觉-视觉一致性约束。给定特定文本描述,VLMGAN* 首先将其编码为文本特征,然后将其输入基于双重视觉-语言匹配的生成模型,以合成照片级真实且文本语义一致的图像。此外,文本到图像合成的流行评价指标借自简单图像生成,主要评估合成图像的真实性与多样性。因此,我们引入一种称为视觉-语言匹配分数(VLMS)的指标来评估文本到图像合成的性能,其可同时考虑图像质量与合成图像和描述间的语义一致性。所提出的双重多级视觉-语言匹配策略可应用于其他文本到图像合成方法。我们在两个流行基线上实现了该策略,分别标记为 和 。在两个广泛使用的数据集上的实验结果表明,该模型相较其他最先进方法取得了显著改进。
引用
@article{arxiv.2208.09596,
title = {Vision-Language Matching for Text-to-Image Synthesis via Generative Adversarial Networks},
author = {Qingrong Cheng and Keyu Wen and Xiaodong Gu},
journal= {arXiv preprint arXiv:2208.09596},
year = {2022}
}
备注
14 pages