用于单会话与多会话i-Vector说话人识别的深度学习
声音
2017-04-24 v1 机器学习
摘要
深度学习(DL)在语音识别中的良好性能促使了DL在其他语音技术应用(如说话人识别)中的使用。给定i-vectors作为输入,作者提出了一种冒名者选择算法和通用模型自适应过程,用于基于深度信念网络(DBN)和深度神经网络(DNN)的混合系统中,以判别性地对每个目标说话人建模。为了更深入地理解DL技术在单会话与多会话说话人注册任务中的行为,本文在两种场景下进行了若干实验。此外,全局模型(称为通用DBN(UDBN))的参数在自适应之前被归一化。UDBN归一化有助于训练具有多个隐藏层的DNN。实验在NIST SRE 2006语料库上进行。结果表明,所提出的冒名者选择算法和UDBN自适应过程在单会话和多会话任务上分别使传统DNN的性能在等错误率(EER)方面提升8–20%和16–20%。在两种场景中,所提出的架构均优于基线系统,获得高达17%的EER降低。
引用
@article{arxiv.1512.02560,
title = {Deep Learning for Single and Multi-Session i-Vector Speaker Recognition},
author = {Omid Ghahabi and Javier Hernando},
journal= {arXiv preprint arXiv:1512.02560},
year = {2017}
}