中文

S-DCCRN:具有可学习复特征用于语音增强的超宽带 DCCRN

音频与语音处理 2021-11-17 v1 声音

摘要

在语音增强中,复神经网络因在处理复值谱方面的有效性而展现出良好性能。近期多数语音增强方法主要关注采样率为 16K Hz 的宽带信号。然而,由于建模更多频带尤其是高频分量的困难,针对超宽带(如 32K Hz)甚至全带(48K)去噪的研究仍然缺乏。本文中,我们将之前的深度复卷积循环神经网络(DCCRN)大幅扩展为超宽带版本——S-DCCRN,以对 32K Hz 采样率的语音进行去噪。我们首先采用级联子带与全带处理模块,其由两个小尺寸 DCCRN 组成——一个作用于子带信号,一个作用于全带信号,旨在同时利用局部与全局频率信息。此外,我们不使用简单的 STFT 特征作为输入,而是使用以端到端方式训练的复特征编码器来精炼不同频带的信息。我们还使用复特征解码器将特征还原至时频域。最后,采用可学习的谱压缩方法来调整不同频带的能量,利于神经网络学习。所提模型 S-DCCRN 已超越 PercepNet 及若干竞争模型,在语音质量与可懂度方面达到最先进性能。消融研究也证实了各改进点的有效性。

关键词

引用

@article{arxiv.2111.08387,
  title  = {S-DCCRN: Super Wide Band DCCRN with learnable complex feature for speech enhancement},
  author = {Shubo Lv and Yihui Fu and Mengtao Xing and Jiayao Sun and Lei Xie and Jun Huang and Yannan Wang and Tao Yu},
  journal= {arXiv preprint arXiv:2111.08387},
  year   = {2021}
}

备注

Submitted to ICASSP 2022