中文

用于高效边缘处理的语音增强深度学习架构

音频与语音处理 2024-05-28 v1

摘要

深度学习已成为语音增强任务的首选方法,在语音质量上取得了显著改善。然而,在低功耗边缘设备上实现减小模型尺寸和计算量的实时处理,会大幅降低语音质量。近期,基于 Transformer 的架构极大降低了内存需求,并通过局部和全局上下文提供了提升模型性能的途径。然而,Transformer 的运算在计算上依然繁重。在本工作中,我们引入了基于 WaveUNet squeeze-excitation Res2 (WSR) 的度量生成对抗网络(WSR-MGAN)架构,该架构可在低功耗边缘设备上高效实现以用于噪声抑制任务,同时保持语音质量。我们利用 Res2Net 模块提取多尺度特征,这与语音处理任务中使用的频谱内容相关。在生成器中,我们将 squeeze-excitation 模块(SEB)与多尺度特征相结合,并配合门控循环单元(GRU)以维持局部和全局上下文。所提出的方法通过在原始波形、多分辨率幅度频谱图以及使用度量判别器的客观指标上计算组合损失函数来进行优化。在 VoiceBank+DEMAND 和 DNS-2020 挑战赛数据集上,基于各种客观指标的实验结果表明,所提出的语音增强(SE)方法优于基线,并在时域上达到了 SOTA 性能。

关键词

引用

@article{arxiv.2405.16834,
  title  = {Speech enhancement deep-learning architecture for efficient edge processing},
  author = {Monisankha Pal and Arvind Ramanathan and Ted Wada and Ashutosh Pandey},
  journal= {arXiv preprint arXiv:2405.16834},
  year   = {2024}
}