中文

用于单麦克风语音增强的深度多帧MVDR滤波

音频与语音处理 2021-05-17 v1 信号处理

摘要

用于单麦克风语音增强的多帧算法,例如多帧最小方差无失真响应(MFMVDR)滤波器,能够在短时傅里叶变换(STFT)域中利用相邻时间帧间的语音相关性。在所需语音帧间相关向量和噪声相关矩阵的准确估计可用的前提下,已证明MFMVDR滤波器可实现大幅噪声抑制且几乎不引入任何语音失真。为融合MFMVDR滤波器的语音增强潜力与 temporal convolutional networks (TCNs,时间卷积网络)的估计能力,本文提出将MFMVDR滤波器嵌入深度学习框架中。TCNs经训练以将含噪语音STFT系数映射到所需量,通过在MFMVDR滤波器输出处最小化尺度不变信号失真比损失函数实现。实验结果表明,所提出的深度MFMVDR滤波器在Deep Noise Suppression Challenge数据集上取得了具有竞争力的语音增强性能。特别地,结果表明估计MFMVDR滤波器参数在PESQ和STOI方面优于直接估计多帧滤波器或单帧掩码以及Conv-TasNet。

关键词

引用

@article{arxiv.2011.10345,
  title  = {Deep Multi-Frame MVDR Filtering for Single-Microphone Speech Enhancement},
  author = {Marvin Tammen and Simon Doclo},
  journal= {arXiv preprint arXiv:2011.10345},
  year   = {2021}
}

备注

submitted to the 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Toronto, Ontario, Canada