中文

从无转写语音中视觉接地学习关键词预测

计算与语言 2017-05-29 v2 计算机视觉与模式识别

摘要

在语言习得过程中,婴儿受益于视觉线索来接地口语。机器人同样可以访问音频和视觉传感器。最近的工作表明,图像和口语说明可以被映射到一个有意义的共同空间,从而允许使用语音检索图像,反之亦然。在这种图像与无转写口语说明配对的情境下,我们考虑是否可以使用计算机视觉系统为语音获取文本标签。具体来说,我们使用一个图像到单词的多标签视觉分类器为图像标记软文本标签,然后训练一个神经网络将语音映射到这些软目标。我们证明,由此产生的语音系统能够预测话语中出现了哪些单词——充当一个口语词袋分类器——而无需看到任何并行的语音和文本。我们发现该模型经常混淆语义相关的词,例如“man”和“person”,这使其作为语义关键词检测器更加有效。

关键词

引用

@article{arxiv.1703.08136,
  title  = {Visually grounded learning of keyword prediction from untranscribed speech},
  author = {Herman Kamper and Shane Settle and Gregory Shakhnarovich and Karen Livescu},
  journal= {arXiv preprint arXiv:1703.08136},
  year   = {2017}
}

备注

5 pages, 3 figures, 5 tables; small updates, added link to code; accepted to Interspeech 2017