中文

一种用于语音增强的非因果 FFTNet 架构

音频与语音处理 2020-06-09 v1 计算与语言 声音

摘要

本文提出一种基于 FFTNet(一种用于生成高质量音频波形的神经网络)的并行、非因果且浅层的波形域语音增强架构。与 WaveNet 等其他基于波形的方法不同,FFTNet 采用初始宽膨胀模式。此类架构能更好地表示时域中语音的长程相关结构,而噪声通常高度不相关,因此适用于基于波形域的语音增强。为进一步加强 FFTNet 的这一特性,我们提出非因果 FFTNet 架构,其中每层的当前样本由上一层过去与未来的样本估计。通过采用浅层网络并在一定限度内施加非因果性,所提出的用于语音增强的 FFTNet (SE-FFTNet) 相较 WaveNet 和 SEGAN 等其他基于神经网络的语音增强方法使用了远更少参数。具体而言,该网络模型参数显著减少:较 WaveNet 少 32%,较 SEGAN 少 87%。最后,基于主观与客观指标,SE-FFTNet 在增强信号质量上优于 WaveNet,同时提供与 SEGAN 同等的良好性能。该架构的 Tensorflow 实现见 1。

关键词

引用

@article{arxiv.2006.04469,
  title  = {A non-causal FFTNet architecture for speech enhancement},
  author = {Muhammed PV Shifas and Nagaraj Adiga and Vassilis Tsiaras and Yannis Stylianou},
  journal= {arXiv preprint arXiv:2006.04469},
  year   = {2020}
}

备注

5 pages