中文

循环一致语音增强

音频与语音处理 2019-05-02 v2 计算与语言 声音

摘要

使用深度神经网络进行特征映射是单通道语音增强的一种有效方法。噪声特征通过映射网络变换为增强特征,并最小化增强特征与干净特征之间的均方误差。本文提出一种循环一致语音增强(CSE),其中引入一个额外的逆映射网络从增强特征重建噪声特征。施加循环一致约束以最小化重建损失。类似地,以相同网络和损失在相反方向执行反向映射循环。借助循环一致性,语音结构在增强特征中得到良好保留,同时噪声被有效抑制,从而使特征映射网络对未见过的数据具有更好的泛化能力。在仅有非平行噪声和干净数据可用于训练的情况下,使用两个判别网络来区分增强特征和噪声特征与干净特征和噪声特征。通过对抗多任务学习,判别损失与重建损失联合优化。在CHiME-3数据集上的评估表明,所提出的CSE在使用或不使用平行干净与噪声语音数据时分别实现了19.60%和6.69%的相对词错误率提升。

关键词

引用

@article{arxiv.1809.02253,
  title  = {Cycle-Consistent Speech Enhancement},
  author = {Zhong Meng and Jinyu Li and Yifan Gong and Biing-Hwang and Juang},
  journal= {arXiv preprint arXiv:1809.02253},
  year   = {2019}
}

备注

5 pages, 2 figures. Interspeech 2018. arXiv admin note: text overlap with arXiv:1809.02251