中文

在多阶段语音增强模型中引入多目标以提升泛化能力

音频与语音处理 2021-07-12 v1

摘要

近期基于深度神经网络(DNNs)的单通道语音增强方法取得了显著成果,但在真实场景中仍存在泛化问题。与其他数据驱动方法一样,基于DNN的语音增强模型在未训练数据上会出现明显的性能下降。本研究充分利用多目标联合学习对模型泛化能力的贡献,提出了一种轻量且低计算量的扩张卷积网络(DCN)模型,用于更鲁棒的语音去噪任务。我们的目标是将掩码目标、映射目标以及传统语音增强估计器的参数整合进一个DCN模型中,以最大化它们的互补优势。为此,我们构建了一个多阶段学习框架来分阶段处理多个目标以实现其联合学习,即`MT-in-MS'。实验结果表明,相较于state-of-the-art的时域和时频域模型,该提出的低成本DCN模型在说话人、噪声和信道失配情况下能取得更好的泛化性能。

关键词

引用

@article{arxiv.2107.04232,
  title  = {Incorporating Multi-Target in Multi-Stage Speech Enhancement Model for Better Generalization},
  author = {Lu Zhang and Mingjiang Wang and Andong Li and Zehua Zhang and Xuyi Zhuang},
  journal= {arXiv preprint arXiv:2107.04232},
  year   = {2021}
}

备注

Submitted to APSIPA-ASC 2021