中文

面向唤醒词检测的前端增益不变建模

音频与语音处理 2020-10-15 v1 机器学习 声音

摘要

由于声学条件的复杂性与多变性以及信号传输中的环境干扰,唤醒词(WW)检测在远场下颇具挑战。一套精心设计与优化的音频前端(AFE)算法有助于缓解这些挑战,并为下游模块(如 WW 检测器)提供更高质量的音频信号。由于 WW 模型使用 AFE 处理后的音频数据训练,其性能对 AFE 变化(如增益改变)敏感。此外,当部署到新设备时,因 WW 模型未知 AFE,WW 性能无法保证。为解决这些问题,我们提出一种新方法,使用称为 Δ\DeltaLFBE 的新特征将 AFE 增益变化与 WW 模型解耦。我们修改了神经网络架构以适应 delta 计算,而特征提取模块保持不变。我们使用真实家庭环境采集的数据评估 WW 模型,表明采用 Δ\DeltaLFBE 的模型对 AFE 增益变化具有鲁棒性。具体而言,当 AFE 增益变化达 ±\pm12dB 时,基线 CNN 模型的误报率相对损失达 19.0% 或误拒率相对损失达 34.3%,而带 Δ\DeltaLFBE 的模型未表现出性能损失。

关键词

引用

@article{arxiv.2010.06676,
  title  = {On Front-end Gain Invariant Modeling for Wake Word Spotting},
  author = {Yixin Gao and Noah D. Stein and Chieh-Chi Kao and Yunliang Cai and Ming Sun and Tao Zhang and Shiv Vitaladevuni},
  journal= {arXiv preprint arXiv:2010.06676},
  year   = {2020}
}

备注

In Proc. Interspeech 2020