用于含噪语音信号基频检测的 LSTM 网络监督初始化
声音
2019-11-13 v1 机器学习
音频与语音处理
摘要
基频是人声最重要的参数之一,对于口音、性别、说话风格、说话人识别、年龄等分类具有重要意义。对于严重退化的信号,该参数的恰当检测仍是一项重要挑战。在先前利用深度学习检测含噪语音中基频的文献中,诸如长短期记忆(LSTM)等网络以随机权重初始化,随后遵循随时间反向传播算法进行训练。本工作提出一种更高效的初始化方案,其基于使用自关联网络的监督训练。该初始化是含噪语音中基频检测的更好起点。在不同信噪比水平下存在加性白噪声时,使用检测精度的客观度量与网络训练的客观度量可明显看出该初始化的优势。
引用
@article{arxiv.1911.04580,
title = {Supervised Initialization of LSTM Networks for Fundamental Frequency Detection in Noisy Speech Signals},
author = {Marvin Coto-Jimenez},
journal= {arXiv preprint arXiv:1911.04580},
year = {2019}
}