中文

面向噪声鲁棒小资源关键词 spotting 的滤波器组学习

音频与语音处理 2023-02-27 v2 人机交互 机器学习 声音

摘要

在关键词 spotting (KWS) 的背景下,用可学习特征替代手工设计的语音特征并未带来更优的 KWS 性能。在本研究中,我们证明只要滤波器组通道数大幅减少,滤波器组学习在 KWS 上就优于手工设计的语音特征。减少通道数可能导致一定的 KWS 性能下降,但也会大幅降低能耗,这在低资源设备上部署常见的始终开启 KWS 时至关重要。在带噪版本的 Google Speech Commands Dataset 上的实验结果表明,滤波器组学习能适应噪声特性,从而提供更高程度的噪声鲁棒性,尤其在集成了 dropout 时。因此,从通常使用的 40 通道 log-Mel 特征切换到 8 通道学习特征,仅导致 3.5% 的相对 KWS 准确率损失,同时实现了 6.3 倍的能耗降低。

关键词

引用

@article{arxiv.2211.10565,
  title  = {Filterbank Learning for Noise-Robust Small-Footprint Keyword Spotting},
  author = {Iván López-Espejo and Ram C. M. C. Shekar and Zheng-Hua Tan and Jesper Jensen and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2211.10565},
  year   = {2023}
}