DESNet:一种用于同步语音去混响、增强与分离的多通道网络
声音
2020-11-17 v3 音频与语音处理
摘要
本文提出一种用于同步语音去混响、增强与分离的多通道网络(DESNet)。为实现梯度传播与联合优化,我们采用了多通道特征的注意力选择机制,该机制最初提出于端到端解混、固定波束成形与提取(E2E-UFE)结构中。此外,采用新颖的深度复数卷积循环网络(DCCRN)作为语音解混的结构,并将基于神经网络的加权预测误差(WPE)前置级联以进行语音去混响。我们还引入分阶段信噪比(SNR)策略与交响损失来训练该网络,以进一步提升最终性能。实验表明,在未去混响情形下,所提 DESNet 在语音增强与分离上优于 DCCRN 及多数 state-of-the-art 结构;而在去混响场景下,DESNet 相较级联的 WPE-DCCRN 网络亦有提升。
引用
@article{arxiv.2011.02131,
title = {DESNet: A Multi-channel Network for Simultaneous Speech Dereverberation, Enhancement and Separation},
author = {Yihui Fu and Jian Wu and Yanxin Hu and Mengtao Xing and Lei Xie},
journal= {arXiv preprint arXiv:2011.02131},
year = {2020}
}
备注
Accepted at IEEE SLT 2021