中文

一种用于单通道语音增强的无掩码神经网络

声音 2023-06-08 v1 人工智能 音频与语音处理

摘要

在语音增强中,目标语音相位缺乏清晰的结构特征,需要使用保守且繁琐的网络框架。使用直接方法与简单网络架构似乎难以取得有竞争力的性能。然而,我们提出MFNet,一种直接且简单的网络,不仅能映射语音,也能映射反向噪声。该网络通过堆叠全局局部former块(GLFBs)构建,其结合了Mobileblock用于全局处理的优势与Metaformer架构用于局部交互的优势。我们的实验结果表明,采用映射方法的网络优于掩码方法,且在强噪声环境下直接映射反向噪声是最优解。在2020年Deep Noise Suppression(DNS)无混响挑战测试集上的横向比较中,据我们所知,MFNet是当前最先进(SOTA)的映射模型。

关键词

引用

@article{arxiv.2306.04286,
  title  = {A Mask Free Neural Network for Monaural Speech Enhancement},
  author = {Liang Liu and Haixin Guan and Jinlong Ma and Wei Dai and Guangyong Wang and Shaowei Ding},
  journal= {arXiv preprint arXiv:2306.04286},
  year   = {2023}
}