用于混响语音分离的共轭预测方法
声音
2021-08-17 v1 音频与语音处理
摘要
我们研究了共轭预测(一种用于语音去混响的线性预测新形式)在混响条件下说话人分离中的有效性。其核心思想是先用深度神经网络(DNN)估计每位说话人的直达路径信号,再辨识所估计直达路径信号的延迟与衰减副本。此类副本很可能由混响引起,可直接去除以实现去混响,或用作另一DNN的额外特征以取得更好的去混响与分离效果。为辨识此类副本,我们在时频(T-F)域高效求解每个频率上的线性回归问题,以估计底层房间脉冲响应(RIR)。在多通道扩展中,我们对共轭预测的输出执行最小方差无失真响应(MVDR)波束成形。波束成形与去混响结果用作第二个DNN的额外特征,以实现更好的分离与去混响。在SMS-WSJ语料库上取得了最先进的结果。
引用
@article{arxiv.2108.07194,
title = {Convolutive Prediction for Reverberant Speech Separation},
author = {Zhong-Qiu Wang and Gordon Wichern and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2108.07194},
year = {2021}
}
备注
in IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2021