USDnet: 基于神经前向滤波的无监督语音去混响
音频与语音处理
2024-08-14 v2 信号处理
摘要
在单说话人的混响条件下,每个远场麦克风在不同位置记录同一说话人信号的混响版本。在过定条件下(多个麦克风但只有一个说话人),每个记录的混合信号可作为约束,缩小目标消声语音的解空间,从而减少混响。基于此洞察,我们提出USDnet,一种用于无监督语音去混响(USD)的新型深度神经网络(DNN)方法。在每个训练步骤中,我们首先将输入混合信号馈入USDnet以生成目标语音的估计,然后对DNN估计进行线性滤波以逼近多麦克风混合信号,从而在每个麦克风处满足约束,进而正则化DNN估计以逼近目标消声语音。线性滤波可基于混合信号和DNN估计通过神经前向滤波算法(如前向卷积预测)进行估计。我们证明,这种新方法可以促进单源混响语音的无监督去混响。
引用
@article{arxiv.2402.00820,
title = {USDnet: Unsupervised Speech Dereverberation via Neural Forward Filtering},
author = {Zhong-Qiu Wang},
journal= {arXiv preprint arXiv:2402.00820},
year = {2024}
}
备注
in IEEE/ACM Transactions on Audio, Speech, and Language Processing