面向多通道语音增强的资源高效语音掩码估计
音频与语音处理
2020-07-23 v1 机器学习
声音
摘要
尽管机器学习技术传统上资源消耗大,我们目前正见证对硬件与能效方法兴趣的上升。对资源高效机器学习的需求主要由嵌入式系统及其在普适计算与物联网(IoT)应用中的使用所驱动。本文中,我们提供一种基于深度神经网络(DNNs)的多通道语音增强资源高效方法。具体而言,我们使用降低精度的 DNN 从含噪多通道麦克风观测中估计语音掩码。该语音掩码用于获取最小方差无失真响应(MVDR)或广义特征值(GEV)波束形成器。在二值权重与降低精度激活的极端情形下,可显著减少执行时间与内存占用,同时仍获得几乎与单精度 DNN 相当的音频质量,以及使用 WSJ0 语音语料库时单说话人场景下略大的词错误率(WER)。
引用
@article{arxiv.2007.11477,
title = {Resource-Efficient Speech Mask Estimation for Multi-Channel Speech Enhancement},
author = {Lukas Pfeifenberger and Matthias Zöhrer and Günther Schindler and Wolfgang Roth and Holger Fröning and Franz Pernkopf},
journal= {arXiv preprint arXiv:2007.11477},
year = {2020}
}