用于说话人识别的语句划分:GMM-SVM框架下的实验综述与新发现分析
机器学习
2021-05-26 v1 信号处理
摘要
说话人识别系统的性能高度依赖于注册与测试中所用语音的时长。本文针对时长可变性存在下的基于GMM-SVM的说话人识别系统,给出详细的实验综述与分析。本文还报告了在时长可变性存在下,GMM-SVM分类器与其前身技术高斯混合模型-通用背景模型(GMM-UBM)分类器的性能比较。本研究工作的目标并非提出一种在时长可变性下提升说话人识别性能的新算法。然而,本工作的主要聚焦于语句划分(UP)——一种常用于补偿时长可变性问题的策略。我们在GMM-SVM框架下详细分析了训练语句划分对说话人识别性能的影响。我们进一步探究了语句划分对提升说话人识别性能至关重要的原因。我们也展示了语句划分在何种情形下有用、在何种情形下无用。我们的研究揭示,语句划分并不能如早期研究所称那样缓解GMM-SVM分类器的数据不平衡问题。除此之外,我们还讨论了诸如高斯数、超向量长度、从语音时长视角看在短时长与长时长测试条件下获得更优性能所需划分量等参数的影响相关问题。我们使用来自包含130名说话人的POLYCOST语料的电话语音进行了实验。
引用
@article{arxiv.2105.11728,
title = {Utterance partitioning for speaker recognition: an experimental review and analysis with new findings under GMM-SVM framework},
author = {Nirmalya Sen and Md Sahidullah and Hemant Patil and Shyamal Kumar das Mandal and Sreenivasa Krothapalli Rao and Tapan Kumar Basu},
journal= {arXiv preprint arXiv:2105.11728},
year = {2021}
}
备注
International Journal of Speech Technology, Springer Verlag, In press