用于单麦克风语音增强的深度多帧MVDR滤波
音频与语音处理
2021-05-17 v1 信号处理
摘要
用于单麦克风语音增强的多帧算法,例如多帧最小方差无失真响应(MFMVDR)滤波器,能够在短时傅里叶变换(STFT)域中利用相邻时间帧间的语音相关性。在所需语音帧间相关向量和噪声相关矩阵的准确估计可用的前提下,已证明MFMVDR滤波器可实现大幅噪声抑制且几乎不引入任何语音失真。为融合MFMVDR滤波器的语音增强潜力与 temporal convolutional networks (TCNs,时间卷积网络)的估计能力,本文提出将MFMVDR滤波器嵌入深度学习框架中。TCNs经训练以将含噪语音STFT系数映射到所需量,通过在MFMVDR滤波器输出处最小化尺度不变信号失真比损失函数实现。实验结果表明,所提出的深度MFMVDR滤波器在Deep Noise Suppression Challenge数据集上取得了具有竞争力的语音增强性能。特别地,结果表明估计MFMVDR滤波器参数在PESQ和STOI方面优于直接估计多帧滤波器或单帧掩码以及Conv-TasNet。
引用
@article{arxiv.2011.10345,
title = {Deep Multi-Frame MVDR Filtering for Single-Microphone Speech Enhancement},
author = {Marvin Tammen and Simon Doclo},
journal= {arXiv preprint arXiv:2011.10345},
year = {2021}
}
备注
submitted to the 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Toronto, Ontario, Canada