中文

基于深度神经网络的语音分离:以低延迟应用为目标优化可懂度客观估计器

声音 2018-07-19 v1 音频与语音处理

摘要

均方误差(MSE)在当前基于深度神经网络(DNN)的语音分离技术中一直是首选的损失函数。本文中,我们提出一种新的代价函数,旨在优化扩展短时客观可懂度(ESTOI)度量。我们关注算法延迟低(≤ 10 ms)重要的应用。我们使用长短期记忆网络(LSTM),并在扩展的丹麦噪声下听觉(HINT)数据集的四组双说话人混合语音上评估所提方法。我们表明,与MSE优化的基线相比,所提损失函数能带来改进或相当的客观可懂度(就ESTOI而言),同时导致较低的客观分离性能(就源失真比(SDR)而言)。我们随后提出一种方法,其中网络首先用针对MSE准则优化的权重初始化,然后用所提ESTOI损失准则训练。该方法在保持客观可懂度增益的同时,缓解了客观分离性能的一些损失。

关键词

引用

@article{arxiv.1807.06899,
  title  = {Deep neural network based speech separation optimizing an objective estimator of intelligibility for low latency applications},
  author = {Gaurav Naithani and Joonas Nikunen and Lars Bramsløw and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:1807.06899},
  year   = {2018}
}

备注

To appear at International Workshop on Acoustic Signal Enhancement (IWAENC) 2018