中文

面向利用弱监督在语音中定位关键词

计算与语言 2020-12-15 v1 音频与语音处理

摘要

弱监督和自监督模型的发展可使语音技术在缺乏完整转写的低资源环境中得以应用。我们考虑是否可以使用两种未显式提供位置信息的弱监督形式来实现关键词定位。第一种仅指示词的出现与否,即词袋(BoW)标注。第二种以图像与无标注语音片段配对的形式提供视觉上下文;然后模型需要使用配对数据以自监督方式训练。对于关键词定位,我们改编了视觉领域常用的基于显著性的方法。我们将其与一种在网络架构中执行定位的现有技术进行比较。虽然基于显著性的方法更灵活(可在无架构限制下应用),我们发现了将其用于关键词定位时的一个关键局限。在两种监督形式中,视觉训练模型的表现劣于BoW训练模型。我们定性地表明,视觉训练模型有时会定位语义相关的词,但这并不稳定。尽管我们的结果显示存在某些允许定位的信号,但也呼吁开发更匹配这些弱监督形式的其它定位方法。

关键词

引用

@article{arxiv.2012.07396,
  title  = {Towards localisation of keywords in speech using weak supervision},
  author = {Kayode Olaleye and Benjamin van Niekerk and Herman Kamper},
  journal= {arXiv preprint arXiv:2012.07396},
  year   = {2020}
}

备注

Accepted to NeurIPS-SAS