中文

利用大规模网络标注图像训练和评估多模态词嵌入

机器学习 2016-11-28 v1 计算与语言 计算机视觉与模式识别

摘要

本文关注利用文本和视觉信息训练和评估有效的词嵌入。更具体地,我们引入一个大规模数据集,包含从 Pinterest 上公开可获取的 Pins(即用户上传的带句子描述的图像)爬取并下载的超过 4000 万张图像和 3 亿个描述句子。该数据集比带有句子描述的标准大规模图像数据集 MS COCO 大 200 多倍。此外,我们构建了一个评估数据集,用于直接评估词嵌入在寻找语义相似或相关单词和短语方面的有效性。该评估数据集中的词/短语对收集自图像搜索系统中数百万用户的点击数据,因此包含丰富的语义关系。基于这些数据集,我们提出并比较了几种基于循环神经网络 (RNNs) 的多模态(文本和图像)模型。实验表明,我们的模型受益于将视觉信息整合进词嵌入,且权重共享策略对于学习此类多模态嵌入至关重要。项目页面为:http://www.stat.ucla.edu/~junhua.mao/multimodal_embedding.html

关键词

引用

@article{arxiv.1611.08321,
  title  = {Training and Evaluating Multimodal Word Embeddings with Large-scale Web Annotated Images},
  author = {Junhua Mao and Jiajing Xu and Yushi Jing and Alan Yuille},
  journal= {arXiv preprint arXiv:1611.08321},
  year   = {2016}
}

备注

Appears in NIPS 2016. The datasets introduced in this work will be gradually released on the project page