中文

DCCRN:用于相位感知语音增强的深度复数卷积循环网络

音频与语音处理 2020-09-24 v4 声音

摘要

语音增强在可懂度和感知质量方面受益于深度学习的成功。传统的时频(TF)域方法侧重于通过朴素的卷积神经网络(CNN)或循环神经网络(RNN)预测 TF 掩码或语音谱。一些近期研究使用复值谱图作为训练目标,但在实值网络中训练,分别预测幅度和相位分量或实部和虚部。特别地,卷积循环网络(CRN)集成了卷积编解码器(CED)结构和长短期记忆(LSTM),已被证明有助于处理复数目标。为了更有效地训练复数目标,本文设计了一种模拟复值运算的新网络结构,称为深度复数卷积循环网络(DCCRN),其中 CNN 和 RNN 结构均可处理复值运算。所提出的 DCCRN 模型在其他先前网络之上极具竞争力,无论是在客观还是主观指标上。仅用 3.7M 参数,我们提交至 Interspeech 2020 深度噪声抑制(DNS)挑战赛的 DCCRN 模型在平均意见得分(MOS)上实时赛道排名第一、非实时赛道排名第二。

关键词

引用

@article{arxiv.2008.00264,
  title  = {DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement},
  author = {Yanxin Hu and Yun Liu and Shubo Lv and Mengtao Xing and Shimin Zhang and Yihui Fu and Jian Wu and Bihong Zhang and Lei Xie},
  journal= {arXiv preprint arXiv:2008.00264},
  year   = {2020}
}

备注

Accepted by Interspeech 2020