多尾、多头、空间动态记忆精炼的文本到图像合成
计算机视觉与模式识别
2021-10-18 v1
摘要
从文本描述合成高质量、真实感图像是一项具有挑战性的任务,当前方法多以多阶段方式从文本合成图像,通常先生成粗糙初始图像,再在后续阶段细化图像细节。然而,遵循该范式的现有方法存在三个重要局限。首先,它们在合成初始图像时未尝试在词级别分离图像属性,导致初始图像的对象属性(为后续细化提供基础)本质上纠缠且模糊。其次,通过对所有区域使用通用文本表示,当前方法阻碍我们在图像不同部分以根本不同的方式解释文本,因此不同图像区域在每个细化阶段仅能同化来自文本的同一类信息。最后,当前方法在每个细化阶段仅生成一次细化特征,并试图一次性解决所有图像方面,这种单步细化限制了每个细化阶段学习改进先验图像的精度。我们提出的方法引入三个新颖组件以解决这些不足:(1)显式为每个词 n-gram 生成独立图像特征集的初始生成阶段。(2)用于图像细化的空间动态记忆模块。(3)迭代多头机制,以更易改进多个方面。实验结果表明,我们的多头部空间动态记忆图像细化结合多尾词级初始生成(MSMT-GAN)在 CUB 和 COCO 数据集上优于先前最优方法。
引用
@article{arxiv.2110.08143,
title = {Multi-Tailed, Multi-Headed, Spatial Dynamic Memory refined Text-to-Image Synthesis},
author = {Amrit Diggavi Seshadri and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2110.08143},
year = {2021}
}