记忆驱动的文本到图像生成
计算机视觉与模式识别
2022-08-16 v1 计算与语言
机器学习
摘要
我们提出了一种基于参数与非参数技术相结合的记忆驱动半参数文本到图像生成方法。非参数组件是由一组训练图像构建的图像特征记忆库。参数组件是一个生成对抗网络(generative adversarial network)。在推理时给定新的文本描述,记忆库被用于选择性检索图像特征,这些特征作为目标图像的基础信息,使生成器能够生成逼真的合成结果。我们还将内容信息与语义特征一同融入判别器,使判别器能做出更可靠的预测。实验结果表明,所提出的记忆驱动半参数方法在视觉保真度与文本-图像语义一致性方面均能生成比纯参数方法更逼真的图像。
引用
@article{arxiv.2208.07022,
title = {Memory-Driven Text-to-Image Generation},
author = {Bowen Li and Philip H. S. Torr and Thomas Lukasiewicz},
journal= {arXiv preprint arXiv:2208.07022},
year = {2022}
}