掩蔽与目标映射在单通道语音增强中的深度交互
音频与语音处理
2021-06-10 v1 声音
摘要
最新的深度神经网络(DNN)模型在时频(T-F)幅度域展现出令人印象深刻的去噪性能。然而,相位也是语音信号中易被忽视的关键组成部分。本文中,我们提出一种多分支扩张卷积网络(DCN)来同时增强含噪语音的幅度与相位。基于复谱与理想比率掩码(IRM)目标的多目标学习框架,实现了一种因果且鲁棒的单通道语音增强系统。在联合学习过程中,IRM 目标的中间估计被用作生成特征注意力因子的方式,以实现两目标间的信息交互。此外,所提出的多尺度扩张卷积使 DCN 模型具备更高效的时序建模能力。实验结果表明,与其他最先进模型相比,该模型以更少的计算量实现了更好的语音质量与可懂度。
引用
@article{arxiv.2106.04878,
title = {Deep Interaction between Masking and Mapping Targets for Single-Channel Speech Enhancement},
author = {Lu Zhang and Mingjiang Wang and Zehua Zhang and Xuyi Zhuang},
journal= {arXiv preprint arXiv:2106.04878},
year = {2021}
}