基于深度神经网络的短语音说话人识别
声音
2016-10-12 v1
摘要
本文研究了在采用深度神经网络(DNN)方法进行说话人验证的背景下,有限语音数据的影响。能够缩短所需语音数据的长度对于现实应用中说话人验证系统的发展至关重要。实验研究发现,基于 DNN-senone 的高斯概率线性判别分析(GPLDA)系统在 NIST 2010 coreext-coreext 和截断的 15秒-15秒 评估条件下,其等错误率(EER)值相较于 GMM-UBM GPLDA 系统分别取得了超过 50% 和 18% 的改进。此外,当 GPLDA 模型在短时长语音(30秒)而非全长语音(2分钟)上训练时,基于 DNN-senone 的 GPLDA 系统在截断的 15秒-15秒 条件下实现了超过 7% 的 EER 值改进。这是因为短时长开发集 i-vector 包含说话人、会话和语音变异,而 GPLDA 能够对这些变异进行稳健建模。对于许多现实应用,可以使用较长语音(2分钟)进行注册,而验证则需要较短语音(15秒),在这些条件下,基于 DNN-senone 的 GPLDA 系统相较于 GMM-UBM GPLDA 系统实现了超过 26% 的 EER 值改进。
引用
@article{arxiv.1610.03190,
title = {DNN based Speaker Recognition on Short Utterances},
author = {Ahilan Kanagasundaram and David Dean and Sridha Sridharan and Clinton Fookes},
journal= {arXiv preprint arXiv:1610.03190},
year = {2016}
}