基于文本引导的图像到图像翻译
计算机视觉与模式识别
2020-02-14 v1 计算与语言
机器学习
摘要
本文的目标是将可控因素,即自然语言描述,嵌入到基于生成对抗网络的图像到图像翻译中,使文本描述能够决定合成图像的视觉属性。我们提出了四个关键组件:(1)使用词性标注过滤给定描述中的非语义词;(2)采用仿射组合模块有效融合不同模态的文本与图像特征;(3)一种新颖的精细化多阶段架构,以增强判别器的区分能力与生成器的校正能力;(4)一种新的结构损失,以进一步改进判别器更好区分真实与合成图像。在COCO数据集上的大量实验表明,我们的方法在视觉真实感与给定描述的语义一致性方面均具有优越性能。
引用
@article{arxiv.2002.05235,
title = {Image-to-Image Translation with Text Guidance},
author = {Bowen Li and Xiaojuan Qi and Philip H. S. Torr and Thomas Lukasiewicz},
journal= {arXiv preprint arXiv:2002.05235},
year = {2020}
}