用于说话人验证的成对判别神经 PLDA
音频与语音处理
2020-02-10 v2 机器学习
声音
信号处理
摘要
说话人验证的最先进方法包括提取如 x-vector 的判别性嵌入,随后使用概率线性判别分析(PLDA)的生成式模型后端。本文中,我们提出一种用于说话人验证任务的成对神经判别模型,其作用于一对说话人嵌入(如 x-vectors/i-vectors)并输出可视为缩放对数似然比的得分。我们构造了一个近似说话人验证损失即最小检测代价的可微分代价函数。线性判别分析(LDA)、单位长度归一化与类内协方差归一化的预处理步骤均被建模为神经模型的层,且说话人验证代价函数可在训练期间通过这些层反向传播。我们还探索了防止过拟合的正则化技术,这是验证任务中使用判别性后端模型的主要关注点。实验在 NIST SRE 2018 开发与评估数据集上进行。我们观察到相较 PLDA 基线系统,在 CMN2 条件下平均相对提升 8%,在 VAST 条件下提升 30%。
引用
@article{arxiv.2001.07034,
title = {Pairwise Discriminative Neural PLDA for Speaker Verification},
author = {Shreyas Ramoji and Prashant Krishnan and Prachi Singh and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2001.07034},
year = {2020}
}
备注
This paper was submitted to IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2020. Link to GitHub Repository: https://github.com/iiscleap/NeuralPlda