面向端到端说话人验证的神经 PLDA 建模
音频与语音处理
2020-08-12 v1 计算与语言
机器学习
声音
摘要
尽管深度学习模型在有监督分类问题上取得了显著进展,但这些模型在说话人识别等集外验证任务中的应用仅限于提取特征嵌入。基于最先进的 x-vector PLDA 的说话人验证系统使用基于概率线性判别分析(PLDA)的生成模型来计算验证分数。最近,我们提出了一种用于说话人验证后端建模的神经网络方法,称为神经 PLDA(NPLDA),其中将生成式 PLDA 模型的似然比分数表示为判别相似性函数,并使用验证代价优化该分数函数的可学习参数。在本文中,我们扩展了该工作,以端到端(E2E)方式实现嵌入神经网络(x-vector 网络)与 NPLDA 网络的联合优化。该提出的端到端模型直接从声学特征以验证代价函数进行优化,在测试期间,模型直接输出似然比分数。利用 NIST 说话人识别评测(SRE)2018 和 2019 数据集进行的各种实验表明,所提出的 E2E 模型相比 x-vector PLDA 基线说话人验证系统有显著改进。
引用
@article{arxiv.2008.04527,
title = {Neural PLDA Modeling for End-to-End Speaker Verification},
author = {Shreyas Ramoji and Prashant Krishnan and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2008.04527},
year = {2020}
}
备注
Accepted in Interspeech 2020. GitHub Implementation Repos: https://github.com/iiscleap/E2E-NPLDA and https://github.com/iiscleap/NeuralPlda