中文

基于干净聚类预训练的混合深度专家语音增强

声音 2021-02-12 v1 机器学习 音频与语音处理

摘要

在本研究中,我们提出了一种用于单麦克风语音增强的混合深度专家(MoDE)神经网络架构。我们的架构包含一组深度神经网络(DNN),每个网络都是不同语音频谱模式(如音素)方面的“专家”。一个门控 DNN 负责潜变量,即给定语音段时分配给每个专家输出的权重。专家从带噪输入估计掩码,最终掩码随后作为各专家估计的加权平均获得,权重由门控 DNN 确定。然后基于估计的掩码施加软频谱衰减,以增强带噪语音信号。作为副产品,我们在测试时复杂度上获得了降低。我们表明,专家的专业化使其对陌生噪声类型具有更好的鲁棒性。

关键词

引用

@article{arxiv.2102.06034,
  title  = {Speech enhancement with mixture-of-deep-experts with clean clustering pre-training},
  author = {Shlomo E. Chazan and Jacob Goldberger and Sharon Gannot},
  journal= {arXiv preprint arXiv:2102.06034},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1703.09302