扫视与凝视:一种用于单通道语音增强的协作学习框架
声音
2021-06-23 v1 音频与语音处理
摘要
人类同时关注粗粒度与细粒度区域的能力已被应用于计算机视觉任务。受此启发,我们提出了一种用于单耳噪声抑制的复数域协作学习框架。所提出的系统由两个主要模块组成,即频谱特征提取模块(FEM)与堆叠的扫视-凝视模块(GGMs)。在FEM中,每个卷积层后引入UNet-block,实现多尺度下的特征重标定。在每个GGM中,我们将复数谱中的多目标优化分解为两个子任务。具体而言,扫视路径旨在幅度域抑制噪声以获得粗估计,同时凝视路径尝试在复数域补偿丢失的频谱细节。两条路径从互补视角协作并促进频谱估计。此外,通过反复展开GGMs,中间结果可在各阶段迭代细化并得到最终的频谱估计。实验在WSJ0-SI84、DNS-Challenge数据集以及Voicebank+Demand数据集上进行。结果表明,所提方法在WSJ0-SI84和DNS-Challenge数据集上取得了优于以往先进系统的state-of-the-art性能,同时在Voicebank+Demand语料上也取得了具有竞争力的性能。
引用
@article{arxiv.2106.11789,
title = {Glance and Gaze: A Collaborative Learning Framework for Single-channel Speech Enhancement},
author = {Andong Li and Chengshi Zheng and Lu Zhang and Xiaodong Li},
journal= {arXiv preprint arXiv:2106.11789},
year = {2021}
}