中文

机器有了耳朵才能听得更清楚

声音 2018-06-06 v2 机器学习 音频与语音处理 机器学习

摘要

基于深度神经网络(DNN)的噪声抑制系统相比谱减法和非负矩阵分解等传统方法有显著改进,但对未训练过的噪声条件泛化能力较差。与DNN相比,人类表现出卓越的噪声抑制能力,在各种不利听音条件和负信噪比(SNR)下仍能实现成功的语音可懂度。受人类优异表现的启发,本文探讨模拟人类耳蜗信号处理的数值模型是否可与DNN结合,以提升基于DNN的噪声抑制系统的鲁棒性。我们将五种耳蜗模型分别耦合到全连接和循环神经网络(RNN)的噪声抑制系统中,并使用客观指标——感知语音质量(PESQ)、分段SNR和对数倒谱距离——在多种噪声条件下进行训练和评估。仿真表明,受生物物理启发的耳蜗模型提升了基于DNN的噪声抑制系统对未知噪声和负SNR的泛化能力。因此,该方法可得到对噪声类型和噪声水平不敏感的鲁棒噪声抑制系统。由于耳蜗模型捕捉了外周听觉处理的固有非线性和动态特性,本文证明考虑其确定性信号处理可改善机器听觉并避免多层DNN的过训练。因此我们得出结论:在DNN输入端使用真实的耳蜗模型时,机器听得更清楚。

关键词

引用

@article{arxiv.1806.01145,
  title  = {Machines hear better when they have ears},
  author = {Deepak Baby and Sarah Verhulst},
  journal= {arXiv preprint arXiv:1806.01145},
  year   = {2018}
}

备注

6 pages