基于视觉锚定的无转录语音模型的语义语音检索
计算与语言
2018-11-02 v2 计算机视觉与模式识别
音频与语音处理
摘要
学界对能够从未标注语音与视觉上下文中学习的模型兴趣日益浓厚。这一设定对低资源语音处理、机器人学及人类语言习得研究均具现实意义。本文研究一个在场景图像与口语描述配对数据上训练的视觉锚定语音模型如何捕捉语义层面。我们使用外部图像标注器从图像生成软文本标签,作为将无转录语音映射到(语义)关键词标签的神经模型的目标。我们引入一个新采集的人类语义相关性判断数据集及一项关联任务——语义语音检索,其目标是根据给定文本查询搜索语义相关的口语语句。在完全未接触文本的情况下,该基于并行语音与图像训练的模型在其前十项语义检索结果上达到了近60%的精确率。与基于转录文本训练的有监督模型相比,我们的模型在某些指标上更贴合人类判断,尤其在检索非逐字语义匹配方面表现更佳。我们对模型及其生成的表示进行了广泛分析。
引用
@article{arxiv.1710.01949,
title = {Semantic speech retrieval with a visually grounded model of untranscribed speech},
author = {Herman Kamper and Gregory Shakhnarovich and Karen Livescu},
journal= {arXiv preprint arXiv:1710.01949},
year = {2018}
}
备注
10 pages, 3 figures, 5 tables; accepted to the IEEE/ACM Transactions on Audio, Speech and Language Processing