GLD-Net:通过 GLD 模块学习全局与局部依赖特征改进单通道语音增强
音频与语音处理
2022-07-01 v1 声音
摘要
对于单通道语音增强,上下文信息对于准确的语音估计十分重要。然而,常用的卷积神经网络(CNN)由于仅构建每次处理一个局部邻域的模块,在捕获时间上下文方面较弱。为解决该问题,我们借鉴人类听觉感知引入一种两阶段可训练推理机制,称为全局-局部依赖(GLD)模块。GLD 模块从含噪谱图中在全局和局部层面捕获时频单元的长期依赖,以帮助检测语音部分、噪声部分与整体含噪输入之间的相关性。此外,我们构建了称为 GLD-Net 的单通道语音增强网络,其采用编码器-解码器架构,由语音目标分支、干扰分支和全局含噪分支组成。在每一分支中,全局与局部层面提取的语音特征被高效推理与聚合。我们在 WSJ0 和 DEMAND 数据集上将所提 GLD-Net 与现有最优方法进行比较。结果表明,GLD-Net 在 PESQ 和 STOI 指标上优于现有最优方法。
引用
@article{arxiv.2206.14962,
title = {GLD-Net: Improving Monaural Speech Enhancement by Learning Global and Local Dependency Features with GLD Block},
author = {Xinmeng Xu and Yang Wang and Jie Jia and Binbin Chen and Jianjun Hao},
journal= {arXiv preprint arXiv:2206.14962},
year = {2022}
}
备注
Accepted by Interspeech 2022