中文

DCCRN+:带信噪比估计的信道式子带 DCCRN 用于语音增强

音频与语音处理 2021-06-17 v1 声音

摘要

深度复数卷积循环网络(DCCRN)将 CRN 扩展为复数结构,在 Interspeech 2020 深度噪声抑制挑战赛(DNS2020)的 MOS 评测中取得了优异性能。本文对 DCCRN 做了如下重要扩展。我们首先将模型扩展为子带处理,其中频带由可学习的神经网络滤波器而非工程化 FIR 滤波器进行分割与合并,从而以端到端方式训练出更快的噪声抑制器。随后将 LSTM 进一步替换为复数 TF-LSTM,以更好地沿时间与频率轴建模时间依赖关系。此外,我们不再简单地将各编码器层输出拼接至对应解码器层输入,而是先使用卷积块从编码器输出中聚合关键信息,再送入解码器层。我们具体在解码器中设计了一个额外的先验信噪比(SNR)估计模块,以在去噪的同时保持良好的语音质量。最后采用后处理模块进一步抑制不自然的残留噪声。新模型命名为 DCCRN+,在 PESQ 与 DNSMOS 上超越了原始 DCCRN 及若干竞争模型,并在新的 Interspeech 2021 DNS 挑战赛中取得了优异性能。

关键词

引用

@article{arxiv.2106.08672,
  title  = {DCCRN+: Channel-wise Subband DCCRN with SNR Estimation for Speech Enhancement},
  author = {Shubo Lv and Yanxin Hu and Shimin Zhang and Lei Xie},
  journal= {arXiv preprint arXiv:2106.08672},
  year   = {2021}
}