中文

面向 SDR 与 PESQ 联合优化的端到端多任务去噪

声音 2023-03-10 v4 机器学习 音频与语音处理 机器学习

摘要

基于深度神经网络的有监督学习近期在语音增强上取得了实质性进展。去噪网络直接学习从带噪语音到干净语音的映射,或学习干净与带噪谱之比的谱掩码。无论哪种情况,网络均通过最小化真实标签与时域或频谱输出之间的均方误差(MSE)来优化。然而,现有方案存在两个关键问题之一:频谱失配与度量失配。频谱失配是一个众所周知的问题,即短时傅里叶变换(STFT)后的任何频谱修改一般无法在逆短时傅里叶变换(ISTFT)后完全恢复。度量失配是指常规 MSE 度量在最大化我们的目标度量——信号失真比(SDR)与语音质量感知评估(PESQ)——方面是次优的。本文提出一种新的端到端去噪框架,以联合优化 SDR 和 PESQ 为目标。首先,网络优化在 ISTFT 后的时域信号上进行,以避免频谱失配。其次,提出两个与 SDR 和 PESQ 度量相关性改善的损失函数以最小化度量失配。实验结果表明,所提去噪方案相较现有方法显著提升了 SDR 与 PESQ 性能。

关键词

引用

@article{arxiv.1901.09146,
  title  = {End-to-End Multi-Task Denoising for joint SDR and PESQ Optimization},
  author = {Jaeyoung Kim and Mostafa El-Khamy and Jungwon Lee},
  journal= {arXiv preprint arXiv:1901.09146},
  year   = {2023}
}