基于 LSTM 的 AE-DNN 约束用于多通道 LP 表述中更好的后期混响抑制
音频与语音处理
2018-12-05 v1 声音
摘要
在短时傅里叶变换(STFT)域中利用多通道线性预测(MCLP)预测后期混响分量是一种增强混响语音的有效手段。传统上,采用语音功率谱密度(PSD)加权的预测误差(WPE)最小化方法来估计预测滤波器。该方法对期望信号 PSD 的估计较为敏感。本文中,我们提出一种基于深度神经网络(DNN)的期望信号 PSD 非线性估计方法。在干净语音 STFT 系数上训练的自编码器被用作期望信号先验。我们探索了基于(i)全连接(FC)前馈和(ii)循环长短期记忆(LSTM)层的两种不同架构。使用真实房间脉冲响应的实验表明,基于 LSTM-DNN 的 PSD 估计在后期混响抑制方面优于传统方法。
引用
@article{arxiv.1812.01346,
title = {LSTM based AE-DNN constraint for better late reverb suppression in multi-channel LP formulation},
author = {Srikanth Raj Chetupalli and Thippur V. Sreenivas},
journal= {arXiv preprint arXiv:1812.01346},
year = {2018}
}