关于有监督单通道时域语音增强的损失函数
声音
2020-01-31 v2 机器学习
音频与语音处理
摘要
许多基于深度学习的语音增强算法被设计为最小化预测语音信号与目标语音信号在某些变换域中的均方误差(MSE)。然而,优化MSE并不一定能保证高语音质量或可懂度,而这正是许多语音增强算法的最终目标。此外,关于损失函数对新兴的时域基于深度学习的语音增强系统的影响所知甚少。我们研究了流行的损失函数如何影响基于深度学习的语音增强系统的性能。首先,我们证明如果接收方是人类听觉系统,受感知启发的损失函数可能更有优势。此外,我们表明学习率是一个关键的设计参数,即使对于基于自适应梯度的优化器也是如此,这一点在文献中通常被忽视。同时,我们发现波形匹配性能指标必须谨慎使用,因为在某些情况下它们可能完全失效。最后,我们表明基于尺度不变信号失真比(SI-SDR)的损失函数在一系列流行的语音增强评价指标中取得了良好的综合性能,这表明SI-SDR是语音增强系统通用损失函数的一个良好候选。
引用
@article{arxiv.1909.01019,
title = {On Loss Functions for Supervised Monaural Time-Domain Speech Enhancement},
author = {Morten Kolbæk and Zheng-Hua Tan and Søren Holdt Jensen and Jesper Jensen},
journal= {arXiv preprint arXiv:1909.01019},
year = {2020}
}
备注
Published in the IEEE Transactions on Audio, Speech and Language Processing