中文

基于监督深度学习的语音增强损失函数综合述评

音频与语音处理 2020-09-28 v1

摘要

基于深度学习的实时语音增强近期取得了巨大进展。由于缺乏可处理的感知优化目标,围绕训练损失产生了诸多迷思,而在许多情况下,损失函数对成功的贡献并未脱离网络架构、特征或训练流程等其他因素而被单独考察。本工作中,我们针对适用于在线逐帧处理的循环神经网络架构,考察了种类广泛的谱损失函数。我们将仅幅度损失与相位感知损失、比值、相关性度量以及压缩度量联系起来。我们的结果表明,将仅幅度目标与相位感知目标结合总能带来提升,即便相位未被增强。此外,使用压缩谱值也带来显著改进。另一方面,相位敏感的改进最好通过线性域损失如平均绝对误差来实现。

关键词

引用

@article{arxiv.2009.12286,
  title  = {A consolidated view of loss functions for supervised deep learning-based speech enhancement},
  author = {Sebastian Braun and Ivan Tashev},
  journal= {arXiv preprint arXiv:2009.12286},
  year   = {2020}
}