用于情感说话环境下说话人识别的新型级联高斯混合模型-深度神经网络分类器
声音
2018-10-12 v1
摘要
本研究旨在提出一种基于称为级联高斯混合模型-深度神经网络(GMM-DNN)的新型分类器,以提升情感说话环境下文本无关说话人识别性能的有效方法。我们当前的工作聚焦于提出、实现并评估一种基于级联高斯混合模型-深度神经网络作为分类器的情感说话环境下说话人识别新方法。结果表明,使用两个不同语音数据库——阿联酋语音数据库(阿拉伯联合酋长国数据集)与模拟与实际压力下的语音(SUSAS)英语数据集,该级联GMM-DNN分类器在各种情感下均改善了说话人识别性能。所提分类器在每个数据集上均优于多层感知机(MLP)与支持向量机(SVM)等经典分类器。基于级联GMM-DNN所取得的说话人识别性能与人工听者主观评估所得性能相近。
引用
@article{arxiv.1810.04908,
title = {Novel Cascaded Gaussian Mixture Model-Deep Neural Network Classifier for Speaker Identification in Emotional Talking Environments},
author = {Ismail Shahin and Ali Bou Nassif and Shibani Hamsa},
journal= {arXiv preprint arXiv:1810.04908},
year = {2018}
}
备注
15 pages