揭示词嵌入的梦境:迈向语言驱动的图像生成
计算机视觉与模式识别
2015-11-24 v2 计算与语言
摘要
我们引入了语言驱动的图像生成,即生成可视化词嵌入语义内容的图像的任务,例如,给定蚱蜢的词嵌入,我们生成一张蚱蜢的自然图像。我们实现了一种基于两个映射函数的简单方法。第一个以词嵌入(例如由 word2vec 工具包产生)作为输入,并将其映射到高层视觉空间(例如由卷积神经网络顶层之一所定义的空间)。第二个函数将此抽象视觉表示映射到像素空间,以生成目标图像。若干用户研究表明,当前系统生成的图像捕捉了词嵌入中编码的概念的一般视觉属性,例如颜色或典型环境,并且足以区分对象的大致类别。
引用
@article{arxiv.1506.03500,
title = {Unveiling the Dreams of Word Embeddings: Towards Language-Driven Image Generation},
author = {Angeliki Lazaridou and Dat Tien Nguyen and Raffaella Bernardi and Marco Baroni},
journal= {arXiv preprint arXiv:1506.03500},
year = {2015}
}
备注
A 6-page version to appear at the Multimodal Machine Learning NIPS 2015 Workshop