利用有限与合成语音数据训练关键词 spotting 模型
音频与语音处理
2020-02-05 v1 机器学习
声音
机器学习
摘要
随着低功耗语音设备的兴起,快速生成用于识别任意关键词集合的模型的需求日益增长。与许多机器学习任务一样,模型创建过程中最具挑战性的部分之一是获取足够的训练数据。在本文中,我们探讨了合成语音数据在训练约 400k 参数的小型语音词检测模型中的有效性。我们并非直接在音频或 MFCC 等低层特征上训练此类模型,而是使用预训练的语音嵌入模型来提取对关键词 spotting 模型有用的特征。利用该语音嵌入,我们展示了仅使用合成语音训练、检测 10 个关键词的模型,等同于使用超过 500 条真实样本训练的模型。我们还表明,不使用我们语音嵌入的模型需要超过 4000 条真实样本训练才能达到相同准确率。
引用
@article{arxiv.2002.01322,
title = {Training Keyword Spotters with Limited and Synthesized Speech Data},
author = {James Lin and Kevin Kilgour and Dominik Roblek and Matthew Sharifi},
journal= {arXiv preprint arXiv:2002.01322},
year = {2020}
}