中文

面向数据高效的唤醒词检测建模

音频与语音处理 2020-10-15 v1 机器学习 声音

摘要

唤醒词(WW)检测在远场场景下具有挑战性,不仅因为信号传输中的干扰,也因为声学环境的复杂性。传统的WW模型训练需要大量带有人工标注的域内WW专用数据,因此难以在缺乏此类数据时构建WW模型。在本文中,我们提出数据高效的解决方案以应对WW建模中的挑战,如域不匹配、噪声条件、有限标注等。我们提出的系统由带有分层数据增强的多条件训练流水线,以及从无转录语音语料库中精确提取WW和易混淆样本的半监督学习流水线组成。从仅10小时域不匹配的WW音频出发,我们能够将训练数据集扩大并丰富20–100倍以捕捉声学复杂性。我们在真实用户数据上的实验表明,所提解决方案通过节省97%的WW专用数据收集和86%的标注带宽,可达到与生产级模型相当的性能。

关键词

引用

@article{arxiv.2010.06659,
  title  = {Towards Data-efficient Modeling for Wake Word Spotting},
  author = {Yixin Gao and Yuriy Mishchenko and Anish Shah and Spyros Matsoukas and Shiv Vitaladevuni},
  journal= {arXiv preprint arXiv:2010.06659},
  year   = {2020}
}