中文

DPCRN:用于单通道语音增强的双路径卷积循环网络

声音 2021-07-13 v1 音频与语音处理

摘要

双路径RNN(DPRNN)被提出以更有效地对极长序列建模,用于时域语音分离。通过将长序列分割为较小块并应用块内与块间RNN,DPRNN在以有限模型规模实现语音分离方面达到了令人满意的性能。本文中,我们将DPRNN模块与卷积循环网络(CRN)结合,设计了一个称为双路径卷积循环网络(DPCRN)的模型,用于时频域语音增强。我们用DPRNN模块替换CRN中的RNN,其中块内RNN用于建模单帧的频谱模式,块间RNN用于建模连续帧之间的依赖关系。凭借仅0.8M参数,所提交的DPCRN模型在Interspeech 2021深度噪声抑制(DNS)挑战赛宽带场景赛道中取得了3.57的总体平均意见得分(MOS)。在其他一些测试集上的评估也显示了我们模型的有效性。

关键词

引用

@article{arxiv.2107.05429,
  title  = {DPCRN: Dual-Path Convolution Recurrent Network for Single Channel Speech Enhancement},
  author = {Xiaohuai Le and Hongsheng Chen and Kai Chen and Jing Lu},
  journal= {arXiv preprint arXiv:2107.05429},
  year   = {2021}
}

备注

5 pages, 1 figure, accepted by Interspeech 2021