语义不变的图像生成文本方法
机器学习
2018-09-28 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
图像描述已证明模型能够在给定输入图像或视频的情况下生成合理的文本。此外,近期图像生成方面的工作表明,以文本作为先验时图像质量有显著提升。我们的工作通过将这两个概念结合,创建了一种能够实现图像与文本双向生成的架构。我们称该网络为多模态向量表示(Multi-Modal Vector Representation, MMVR)。除 MMVR 外,我们针对文本条件图像生成提出两项改进。首先,引入基于 n-gram 度量的代价函数,使描述相对于图像具有泛化能力。其次,表明多个语义相似的句子有助于生成更好的图像。定性与定量评估表明,MMVR 在现有文本条件图像生成结果上提升了超过 20%,同时实现了视觉与文本模态的融合。
引用
@article{arxiv.1809.10274,
title = {Semantically Invariant Text-to-Image Generation},
author = {Shagan Sah and Dheeraj Peri and Ameya Shringi and Chi Zhang and Miguel Dominguez and Andreas Savakis and Ray Ptucha},
journal= {arXiv preprint arXiv:1809.10274},
year = {2018}
}
备注
5 papers, 5 figures, Published in 2018 25th IEEE International Conference on Image Processing (ICIP)