面向感知语音度量联合优化的端到端多任务去噪
声音
2020-05-12 v2 音频与语音处理
摘要
尽管基于深度神经网络的有监督学习近期在语音增强上取得实质进展,现有方案仍存在两个关键问题之一:频谱失配或度量失配。频谱失配是众所周知的问题,即短时傅里叶变换(STFT)后的任何频谱修改,一般无法在逆短时傅里叶变换(ISTFT)后完全恢复。度量失配是指常规均方误差(MSE)损失函数通常并非最大化感知语音度量(如信号失真比(SDR)、语音质量感知评估(PESQ)与短时客观可懂度(STOI))的最优选择。本文提出一种新的端到端去噪框架。首先,网络优化在 ISTFT 后的时域信号上进行,以避免频谱失配。其次,提出基于 SDR、PESQ 与 STOI 的三种损失函数以最小化度量失配。实验结果表明,所提去噪方案在 SDR、PESQ 与 STOI 性能上显著优于现有方法。此外,所提方案在训练时未用作损失函数的感知语音度量上,相较生成式去噪模型也提供了良好的泛化性能。
引用
@article{arxiv.1910.10707,
title = {End-to-End Multi-Task Denoising for the Joint Optimization of Perceptual Speech Metrics},
author = {Jaeyoung Kim and Mostafa El-Khamy and Jungwon Lee},
journal= {arXiv preprint arXiv:1910.10707},
year = {2020}
}
备注
5 pages, submitted to Interspeech 2020. arXiv admin note: substantial text overlap with arXiv:1901.09146