基于延迟子带 LSTM 的在线单通道语音增强
声音
2023-12-13 v1 音频与语音处理
摘要
本文提出一种用于在线单通道(单麦克风)语音增强的延迟子带 LSTM 网络。所提方法在短时傅里叶变换(STFT)域中开发。在线处理需要逐帧接收和处理信号。所提方法的一个首要特征是,相同的 LSTM 跨频率使用,这大幅减少了网络参数数量、训练数据量和计算负担。训练以子带方式进行:输入包含一个频率以及少数上下文频率。该网络基于信号平稳性和局部谱模式学习语音-噪声判别函数,并据此在每个频率预测干净语音掩码。为利用未来信息(即前瞻),我们提出一种输出延迟的子带架构,其允许单向前向网络除当前帧外还处理少数未来帧。我们利用所提方法参与 DNS 实时语音增强挑战赛。使用 DNS 数据集的实验表明,所提方法取得了比 DNS 基线方法更优的性能度量分数,后者使用门控循环单元网络学习全带谱。
引用
@article{arxiv.2005.05037,
title = {Online Monaural Speech Enhancement Using Delayed Subband LSTM},
author = {Xiaofei Li and Radu Horaud},
journal= {arXiv preprint arXiv:2005.05037},
year = {2023}
}
备注
Paper submitted to Interspeech 2020