中文

DMF-Net:一种面向全频带语音增强的解耦式多频带融合模型

声音 2022-08-02 v4 音频与语音处理

摘要

由于对更多频带建模的难度和高计算复杂度,基于深度神经网络的全频带语音增强仍具挑战性。以往研究通常采用 Bark 和 ERB 尺度下频率分辨率相对较低的压缩全频带语音特征,导致性能下降,尤其在高频区域。本文提出一种解耦式多频带融合模型,用于执行全频带语音降噪和去混响。我们并未通过单一网络结构优化全频带语音,而是将全频带目标分解为多个子带语音特征,然后采用多阶段链式优化策略逐阶段估计纯净频谱。具体而言,低频(0-8 kHz)、中频(8-16 kHz)和高频(16-24 kHz)区域由三个独立的子网络映射,随后融合得到全频带纯净目标 STFT 频谱。在两个公开数据集上的综合实验表明,所提方法优于以往先进系统,并在真实复杂场景下在语音质量和可懂度方面取得了有前景的性能。

关键词

引用

@article{arxiv.2203.00472,
  title  = {DMF-Net: A decoupling-style multi-band fusion model for full-band speech enhancement},
  author = {Guochen Yu and Yuansheng Guan and Weixin Meng and Chengshi Zheng and Hui Wang},
  journal= {arXiv preprint arXiv:2203.00472},
  year   = {2022}
}