利用循环深度神经网络从含噪语音波形到单正弦回归估计 F0 轮廓
音频与语音处理
2018-07-03 v1 计算与语言
声音
机器学习
摘要
基频(F0)表示语音中的音高,决定语音的韵律特征,并且在语音分析与合成的多种任务中都需要用到。尽管该课题已有数十年的研究,在低信噪比(SNR)及未知噪声条件下估计 F0 仍然困难。本工作提出一种使用以监督方式训练的循环神经网络(RNN)进行噪声鲁棒 F0 估计的新方法。近期研究将深度神经网络(DNN)用于 F0 跟踪,作为逐帧分类到量化频率状态的任务,但我们提出波形到正弦回归,以同时实现噪声鲁棒性和具有更高频率分辨率的准确估计。使用被加性噪声(NOISEX-92)污染的 PTDB-TUG 语料库的试验结果表明,在 SNR 为 -10 dB 到 +10 dB 之间时,与著名的噪声鲁棒 F0 跟踪器 PEFAC 相比,所提方法将总音高错误(GPE)率和精细音高错误(FPE)率降低了 35% 以上。此外,在上述 SNR 范围内,所提方法在 FPE 和 GPE 率两方面均优于最先进的基于 DNN 的方法 15% 以上。
引用
@article{arxiv.1807.00752,
title = {Waveform to Single Sinusoid Regression to Estimate the F0 Contour from Noisy Speech Using Recurrent Deep Neural Networks},
author = {Akihiro Kato and Tomi Kinnunen},
journal= {arXiv preprint arXiv:1807.00752},
year = {2018}
}
备注
Accepted by peer reviewing for Interspeech 2018