中文

基于视觉接地语音模型在未转写语音中的关键词定位

计算与语言 2022-11-23 v1 声音 音频与语音处理

摘要

关键词定位是在语音 utterance 中找出给定查询关键词出现位置的任务。我们研究了在多大程度上可以使用视觉接地语音(VGS)模型进行关键词定位。VGS模型在成对的未标注图像与口语描述上训练。因此这些模型是自监督的——训练时不使用任何显式文本标签或位置信息。为获得训练目标,我们首先使用具有固定词汇表的预训练视觉分类器为训练图像打上软文本标签。这使得VGS模型能够预测 utterance 中是否存在某个书面关键词,但无法预测其位置。我们考虑了四种赋予VGS模型定位能力的方法。其中两种——显著性方法和输入掩码——可在训练后应用于任意预测模型,而另外两种——注意力机制和得分聚合方法——直接整合进模型结构中。基于掩码的定位给出了VGS模型中报告的一些最佳定位分数,当系统已知 utterance 中存在某关键词并需预测其位置时,准确率为57%。在定位于检测之后进行的设定下,取得了25%的F1F_1;在先进行关键词 spotting 排序遍的设定下,我们得到32%的局部化P@10。虽然与来自转写的无序词袋监督这一理想化设定相比这些分数不高,但这些模型未接收任何文本或位置监督。进一步分析表明,这些模型受限于首遍检测或排序。此外,单个关键词定位性能与视觉分类器的标注性能相关。我们还定性地展示了语义错误发生的方式与位置,例如当以ocean为查询时模型定位到surfer。

关键词

引用

@article{arxiv.2202.01107,
  title  = {Keyword localisation in untranscribed speech using visually grounded speech models},
  author = {Kayode Olaleye and Dan Oneata and Herman Kamper},
  journal= {arXiv preprint arXiv:2202.01107},
  year   = {2022}
}

备注

10 figures, 5 tables