面向文本生成图像任务的语义解耦方法
计算机视觉与模式识别
2019-04-03 v1
摘要
从文本描述合成逼真图像是一个具有挑战性的问题。以往研究在生成图像的视觉质量上取得了显著进展。本文考虑利用输入文本描述中的语义来辅助渲染逼真图像。然而,多样的语言表达即使在描绘同一事物时,也为提取一致的语义带来了挑战。为此,我们提出了一种新颖的逼真文本到图像生成模型,该模型隐式地解耦语义,以同时满足高层语义一致性和低层语义多样性。具体而言,我们设计了(1)判别器中的连体机制以学习一致的高层语义,以及(2)通过语义条件批归一化实现的视觉-语义嵌入策略以发现多样的低层语义。在 CUB 和 MS-COCO 数据集上的大量实验和消融研究证明了所提方法相较于 SOTA 方法的优越性。
引用
@article{arxiv.1904.01480,
title = {Semantics Disentangling for Text-to-Image Generation},
author = {Guojun Yin and Bin Liu and Lu Sheng and Nenghai Yu and Xiaogang Wang and Jing Shao},
journal= {arXiv preprint arXiv:1904.01480},
year = {2019}
}
备注
14 pages, 11 figures, accepted as an ORAL at CVPR2019