面向语音与图像的深度多模态语义嵌入
计算机视觉与模式识别
2015-11-13 v1 人工智能
计算与语言
摘要
本文提出一种模型,其以带有相关语音描述的图像语料库作为输入,并寻找两种模态之间的对应关系。我们采用一对卷积神经网络在词级别上对视觉对象和语音信号建模,并通过一个嵌入与对齐模型将网络连接起来,该模型学习两种模态之上的联合语义空间。我们在Flickr8k数据集上使用图像搜索与标注任务评估我们的模型,该数据集我们通过使用Amazon Mechanical Turk收集40,000条语音描述进行了扩充。
引用
@article{arxiv.1511.03690,
title = {Deep Multimodal Semantic Embeddings for Speech and Images},
author = {David Harwath and James Glass},
journal= {arXiv preprint arXiv:1511.03690},
year = {2015}
}