中文

低资源语义语音检索中视觉与文本监督的贡献

计算与语言 2019-09-04 v2 声音 音频与语音处理

摘要

近期研究表明,即便没有任何文本监督,与图像配对的语音也可用于学习具有语义意义的语音表示。然而,在现实世界的低资源设定中,我们常常能获得一些转写语音。我们研究了在存在不同数量文本监督的情况下,视觉接地是否有用以及如何有用。特别地,我们考虑低资源设定下的语义语音检索任务。我们使用一个先前研究过的数据集和任务,其中模型在带有口语字幕的图像上训练,并根据人类对语义相关性的判断进行评估。我们提出一种多任务学习方法来利用视觉和文本两种模态,其中视觉监督来自外部标注器的关键词概率形式。我们发现即使在有文本监督的情况下,视觉接地仍是有帮助的,并且我们在一系列转写数据集规模上分析了该效应。在约 5 小时转写语音下,同时使用视觉监督使我们获得高 23% 的平均精度。

关键词

引用

@article{arxiv.1904.10947,
  title  = {On the Contributions of Visual and Textual Supervision in Low-Resource Semantic Speech Retrieval},
  author = {Ankita Pasad and Bowen Shi and Herman Kamper and Karen Livescu},
  journal= {arXiv preprint arXiv:1904.10947},
  year   = {2019}
}