以少量样本教关键词 spotting 模型识别新关键词
音频与语音处理
2021-06-07 v1 计算与语言
机器学习
声音
摘要
仅用少量样本学习识别新关键词,对于将关键词 spotting(KWS)模型个性化至用户所选关键词至关重要。然而,现代 KWS 模型通常在大型数据集上训练且局限于小规模关键词词表,限制了它们向广泛未见关键词的迁移能力。为迈向易定制的 KWS 模型,我们提出 KeySEM(Keyword Speech EMbedding,关键词语音嵌入),一种在识别大量关键词任务上预训练的语音嵌入模型。KeySEM 提供的语音表示对于从有限样本学习新关键词极为有效。在多个数据集上与各类相关工作的比较表明,我们的方法以更少训练样本取得了一致更优的性能。尽管 KeySEM 仅以英语语音预训练,性能提升也延伸至其他四种语言的数据集,表明 KeySEM 学到了与关键词 spotting 任务高度对齐的有用表示。最后,我们展示了 KeySEM 顺序学习新关键词的能力,无需在已学关键词上重新训练。我们的实验观察表明,KeySEM 非常适用于设备端环境,其中部署后学习与易定制常为所需。
引用
@article{arxiv.2106.02443,
title = {Teaching keyword spotters to spot new keywords with limited examples},
author = {Abhijeet Awasthi and Kevin Kilgour and Hassan Rom},
journal= {arXiv preprint arXiv:2106.02443},
year = {2021}
}
备注
In INTERSPEECH 2021