中文

分布偏移下的唤醒词检测

声音 2022-07-15 v1 人工智能 机器学习 音频与语音处理

摘要

我们提出了一种用于半监督学习(SSL)的新方法,旨在克服关键词 spotting(KWS)任务中训练数据与真实世界数据之间的分布偏移。训练数据分布的偏移是真实世界KWS任务的关键挑战:当新模型部署在设备上时,被接受数据的门控会发生分布偏移,使得通过后续部署及时更新变得困难。尽管存在偏移,我们假设标签的边际分布不发生变化。我们利用改进的师生训练框架,将带标签训练数据与无标签数据增强结合。需注意教师模型同样无法访问新分布。为有效利用人工与教师标注混合数据训练,我们基于置信度启发式开发了教师标注策略,以降低教师模型标签分布的熵;随后对数据进行采样以匹配标签的边际分布。大规模实验结果表明,在远场音频上训练、并在来自不同分布的远场音频上评估的卷积神经网络(CNN),在相等错误拒绝率(FRR)下假发现率(FDR)获得14.3%的相对提升,而在无分布偏移下FDR提升5%。在从远场到近场音频的更严峻分布偏移下,使用较小的全连接网络(FCN),我们的方法在相等FRR下FDR获得52%的相对提升,而在原始分布上FDR相对提升20%。

关键词

引用

@article{arxiv.2207.06423,
  title  = {Wakeword Detection under Distribution Shifts},
  author = {Sree Hari Krishnan Parthasarathi and Lu Zeng and Christin Jose and Joseph Wang},
  journal= {arXiv preprint arXiv:2207.06423},
  year   = {2022}
}