中文

噪声抑制损失对语音失真与ASR性能的影响

音频与语音处理 2021-11-24 v1 声音

摘要

基于深度学习的语音增强在提升质量方面取得了快速发展,同时模型变得更加紧凑,可用于边缘端实时推理。然而,语音质量随模型规模直接变化,小模型往往仍无法实现足够的质量。此外,引入的语音失真与伪影严重损害语音质量与可懂度,并常显著降级自动语音识别(ASR)率。本工作中,我们阐明了谱复数压缩均方误差(MSE)损失的成功之处,及其幅度与相位感知项如何关联语音失真与噪声抑制之间的权衡。我们进一步研究了集成预训练的无参考平均意见得分(MOS)与词错误率(WER)预测器,以及用于 ASR 与声音事件检测的预训练嵌入。我们的分析表明,相较于强谱损失,所加入的预训练网络均未带来显著性能提升。

关键词

引用

@article{arxiv.2111.11606,
  title  = {Effect of noise suppression losses on speech distortion and ASR performance},
  author = {Sebastian Braun and Hannes Gamper},
  journal= {arXiv preprint arXiv:2111.11606},
  year   = {2021}
}

备注

submitted to ICASSP 2022