中文

NPLDA:一种用于说话人确认的深度神经 PLDA 模型

音频与语音处理 2020-05-26 v2 计算与语言 机器学习 声音

摘要

说话人确认的最先进方法由一个基于神经网络的嵌入提取器以及一个如概率线性判别分析(PLDA)之类的后端生成模型组成。本文中,我们提出一种用于说话人识别中后端建模的神经网络方法。将生成式 PLDA 模型的似然比得分表述为一个判别相似性函数,并使用确认代价优化该得分函数的可学习参数。所提出的模型称为神经 PLDA(NPLDA),使用生成式 PLDA 模型参数进行初始化。NPLDA 模型的损失函数是最小检测代价函数(DCF)的近似。使用 NPLDA 模型的说话人识别实验在 VOiCES 数据集以及 SITW 挑战数据集的说话人确认任务上完成。在这些实验中,使用所提损失函数优化的 NPLDA 模型相比最先进的基于 PLDA 的说话人确认系统有显著提升。

关键词

引用

@article{arxiv.2002.03562,
  title  = {NPLDA: A Deep Neural PLDA Model for Speaker Verification},
  author = {Shreyas Ramoji and Prashant Krishnan and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2002.03562},
  year   = {2020}
}

备注

Published in Odyssey 2020, the Speaker and Language Recognition Workshop (VOiCES Special Session). Link to GitHub Implementation: https://github.com/iiscleap/NeuralPlda. arXiv admin note: substantial text overlap with arXiv:2001.07034