无波束成形的多通道语音增强
声音
2022-04-07 v2 音频与语音处理
摘要
深度神经网络常与传统的空间滤波器(如MVDR波束成形器)结合以有效利用空间信息。尽管单阶段端到端监督模型可获得令人印象深刻的增强效果,但将其与传统波束成形器和基于DNN的后滤波器在多级处理中结合可带来额外改进。在本工作中,我们提出一种无需传统波束成形器即可获得额外性能的两阶段多通道语音增强策略。首先,我们提出一种新颖的注意力密集卷积网络(ADCN)用于估计复谱图的实部与虚部,ADCN在单阶段模型中取得了最先进的结果。接下来,我们将ADCN与近期提出的三路径注意力循环网络(TPARN)结合用于估计波形采样点。所提策略利用了两点见解:第一,在两阶段中使用不同方法;第二,在第一阶段使用更强的模型。我们通过评估两阶段方法中含与不含传统波束成形器的多个模型,说明了我们策略的有效性。
引用
@article{arxiv.2110.13130,
title = {Multichannel Speech Enhancement without Beamforming},
author = {Asutosh Pandey and Buye Xu and Anurag Kumar and Jacob Donley and Paul Calamia and DeLiang Wang},
journal= {arXiv preprint arXiv:2110.13130},
year = {2022}
}
备注
Accepted for publication in ICASSP 2022