即插即用多语言少样本语音词识别
音频与语音处理
2023-05-08 v1 机器学习
声音
摘要
随着技术进步与数字设备普及,无缝人机通信日益重要。移动、可穿戴及其他物联网(IoT)设备的广泛采用改变了我们与这些智能设备的交互方式,使得准确的语音词识别成为有效交互的关键组件。然而,构建能处理新关键词的鲁棒语音词检测系统仍具挑战,尤其对于训练数据有限的低资源语言。在此,我们提出PLiX,一个多语言、即插即用的关键词 spotting 系统,其利用少样本学习挖掘海量真实世界数据,并在测试时识别未见语音词。我们的少样本深度模型使用跨20种语言的数百万个一秒音频片段学习,在取得最先进性能的同时高度高效。广泛评估表明,PLiX仅需一个支持样本即可泛化至新语音词,并对未见语言开箱即用表现良好。我们发布模型与推理代码,以作为未来研究及新兴设备语音用户界面开发的基础。
引用
@article{arxiv.2305.03058,
title = {Plug-and-Play Multilingual Few-shot Spoken Words Recognition},
author = {Aaqib Saeed and Vasileios Tsouvalas},
journal= {arXiv preprint arXiv:2305.03058},
year = {2023}
}
备注
Code: https://github.com/FewshotML/plix