中文

使用最优比率掩码作为监督语音分离的训练目标

声音 2017-09-05 v1 计算与语言

摘要

监督语音分离使用监督学习算法来学习从输入含噪信号到输出目标的映射。随着深度学习的快速发展,监督分离已成为近年来语音分离领域最重要的方向。对于监督算法,训练目标对性能有显著影响。理想比率掩码是常用的训练目标,可改善分离语音的可懂度与质量。然而,它未考虑噪声与干净语音之间的相关性。本文中,我们使用最优比率掩码作为深度神经网络 (DNN) 用于语音分离的训练目标。实验在各种噪声环境和信噪比 (SNR) 条件下进行。结果表明最优比率掩码总体上优于其他训练目标。

关键词

引用

@article{arxiv.1709.00917,
  title  = {Using Optimal Ratio Mask as Training Target for Supervised Speech Separation},
  author = {Shasha Xia and Hao Li and Xueliang Zhang},
  journal= {arXiv preprint arXiv:1709.00917},
  year   = {2017}
}