中文

基于延迟子带 LSTM 的在线单通道语音增强

声音 2023-12-13 v1 音频与语音处理

摘要

本文提出一种用于在线单通道(单麦克风)语音增强的延迟子带 LSTM 网络。所提方法在短时傅里叶变换(STFT)域中开发。在线处理需要逐帧接收和处理信号。所提方法的一个首要特征是,相同的 LSTM 跨频率使用,这大幅减少了网络参数数量、训练数据量和计算负担。训练以子带方式进行:输入包含一个频率以及少数上下文频率。该网络基于信号平稳性和局部谱模式学习语音-噪声判别函数,并据此在每个频率预测干净语音掩码。为利用未来信息(即前瞻),我们提出一种输出延迟的子带架构,其允许单向前向网络除当前帧外还处理少数未来帧。我们利用所提方法参与 DNS 实时语音增强挑战赛。使用 DNS 数据集的实验表明,所提方法取得了比 DNS 基线方法更优的性能度量分数,后者使用门控循环单元网络学习全带谱。

关键词

引用

@article{arxiv.2005.05037,
  title  = {Online Monaural Speech Enhancement Using Delayed Subband LSTM},
  author = {Xiaofei Li and Radu Horaud},
  journal= {arXiv preprint arXiv:2005.05037},
  year   = {2023}
}

备注

Paper submitted to Interspeech 2020