中文

基于度量学习与音素到嵌入映射的多语种示例查询关键词 spotting

音频与语音处理 2023-04-20 v1

摘要

本文提出一种基于残差神经网络的多语种示例查询关键词 spotting (KWS) 系统。该模型在从Common Voice语句中提取的多语种关键词数据集上作为分类器训练,并使用circle loss微调。我们展示了模型对新语言的泛化能力,并报告与竞争性基线相比,对已见语言的EER平均降低59.2%,对未见语言降低47.9%。我们表明,KWS模型学习到的词嵌入可通过简单LSTM模型从音素序列准确预测。我们的系统在使用每关键词仅5个示例的Common Voice音频上实现了有前景的流式关键词 spotting与关键词搜索精度。在Hey-Snips数据集上的实验显示出良好性能,在每小时仅0.1次误报下假负率为5.4%。

关键词

引用

@article{arxiv.2304.09585,
  title  = {Multilingual Query-by-Example Keyword Spotting with Metric Learning and Phoneme-to-Embedding Mapping},
  author = {Paul M. Reuter and Christian Rollwage and Bernd T. Meyer},
  journal= {arXiv preprint arXiv:2304.09585},
  year   = {2023}
}

备注

Accepted to ICASSP 2023