中文

一种用于端到端神经网络语音增强的多尺度自编码器(MSAE)框架

音频与语音处理 2023-09-22 v1 声音

摘要

基于单通道语音增强的神经网络方法近来受到广泛关注。特别是,基于掩码(mask-based)的架构相比传统方法取得了显著的性能提升。本文提出了一种用于基于掩码的端到端神经网络语音增强的多尺度自编码器(MSAE)。该MSAE在独立的带限分支内对输入波形进行谱分解,每个分支以不同的速率和尺度运行,以提取多尺度嵌入序列。所提出的框架具有直观的自编码器参数化,包括基于常Q变换(Constant-Q transform)的灵活频带设计。此外,MSAE完全由可微算子构成,使其能够在端到端神经网络内实现,并进行判别性训练。MSAE的动机既来自近期的多尺度网络拓扑,也来自语音处理中的传统多分辨率变换。实验结果表明,相对于传统的单分支自编码器,MSAE提供了明显的性能优势。此外,所提出的框架在客观语音质量指标和自动语音识别准确率方面均优于多种最先进(state-of-the-art)的增强系统。

关键词

引用

@article{arxiv.2309.12121,
  title  = {A Multiscale Autoencoder (MSAE) Framework for End-to-End Neural Network Speech Enhancement},
  author = {Bengt J. Borgstrom and Michael S. Brandstein},
  journal= {arXiv preprint arXiv:2309.12121},
  year   = {2023}
}

备注

13 pages, 9 figures