中文

即插即用多语言少样本语音词识别

音频与语音处理 2023-05-08 v1 机器学习 声音

摘要

随着技术进步与数字设备普及,无缝人机通信日益重要。移动、可穿戴及其他物联网(IoT)设备的广泛采用改变了我们与这些智能设备的交互方式,使得准确的语音词识别成为有效交互的关键组件。然而,构建能处理新关键词的鲁棒语音词检测系统仍具挑战,尤其对于训练数据有限的低资源语言。在此,我们提出PLiX,一个多语言、即插即用的关键词 spotting 系统,其利用少样本学习挖掘海量真实世界数据,并在测试时识别未见语音词。我们的少样本深度模型使用跨20种语言的数百万个一秒音频片段学习,在取得最先进性能的同时高度高效。广泛评估表明,PLiX仅需一个支持样本即可泛化至新语音词,并对未见语言开箱即用表现良好。我们发布模型与推理代码,以作为未来研究及新兴设备语音用户界面开发的基础。

关键词

引用

@article{arxiv.2305.03058,
  title  = {Plug-and-Play Multilingual Few-shot Spoken Words Recognition},
  author = {Aaqib Saeed and Vasileios Tsouvalas},
  journal= {arXiv preprint arXiv:2305.03058},
  year   = {2023}
}

备注

Code: https://github.com/FewshotML/plix