中文

用于单通道语音去混响及噪声-混响条件下说话人分离的卷积预测方法

声音 2021-11-11 v2 音频与语音处理

摘要

一种有前景的语音去混响方法基于监督学习,即训练深度神经网络(DNN)从噪声-混响语音中预测直达声。这种数据驱动方法利用了干净语音模式的先验知识,却很少显式利用混响中的线性滤波结构,即混响源于房间脉冲响应(RIR)与干燥源信号之间的线性卷积。在本工作中,我们提出在基于深度学习的单通道语音去混响框架内利用该线性滤波结构。核心思想是先用 DNN 估计目标说话人的直达路径信号,再识别作为所估计直达路径信号的衰减且延迟副本的信号,因为这些可可靠地视为混响。它们既可直接去除以实现去混响,也可用作另一 DNN 的额外特征以获得更好的去混响效果。为识别这些副本,我们通过高效求解时频域中每个频率上的线性回归问题来估计底层滤波器(或 RIR)。随后我们改进所提算法,用于混响及噪声-混响条件下的说话人分离。在 REVERB、SMS-WSJ 和 WHAMR! 数据集上取得了最先进的语音去混响与说话人分离结果。

关键词

引用

@article{arxiv.2108.07376,
  title  = {Convolutive Prediction for Monaural Speech Dereverberation and Noisy-Reverberant Speaker Separation},
  author = {Zhong-Qiu Wang and Gordon Wichern and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2108.07376},
  year   = {2021}
}

备注

in IEEE/ACM Transactions on Audio, Speech, and Language Processing