中文

TinyLSTMs:用于助听器的高效神经语音增强

音频与语音处理 2021-09-15 v1 机器学习 声音 机器学习

摘要

现代语音增强算法通过大型循环神经网络(RNN)实现了显著的噪声抑制。然而,大型RNN限制了在助听器硬件(HW)形态中的实际部署,这些设备由电池供电,并在内存容量和计算能力有限的资源受限微控制器单元(MCU)上运行。在这项工作中,我们使用模型压缩技术来弥合这一差距。我们定义了硬件对RNN施加的约束,并描述了一种满足这些约束的方法。尽管模型压缩技术是一个活跃的研究领域,但我们首次通过使用权重/激活的剪枝和整数量化,证明了它们对RNN语音增强的有效性。我们还演示了状态更新跳过,这减少了计算负载。最后,我们对压缩模型进行了感知评估,以验证人类评分者的音频质量。结果显示,与基线相比,压缩模型的模型大小和操作数分别减少了11.9倍和2.9倍,在听觉偏好上没有统计差异,仅表现出0.55dB SDR的损失。我们的模型实现了2.39毫秒的计算延迟,远在10毫秒的目标之内,并且比先前的工作好351倍。

关键词

引用

@article{arxiv.2005.11138,
  title  = {TinyLSTMs: Efficient Neural Speech Enhancement for Hearing Aids},
  author = {Igor Fedorov and Marko Stamenovic and Carl Jensen and Li-Chia Yang and Ari Mandell and Yiming Gan and Matthew Mattina and Paul N. Whatmough},
  journal= {arXiv preprint arXiv:2005.11138},
  year   = {2021}
}

备注

First four authors contributed equally. For audio samples, see https://github.com/BoseCorp/efficient-neural-speech-enhancement