中文

端到端说话人识别中神经网络里的绑定隐变量

音频与语音处理 2019-01-01 v1 机器学习 声音 机器学习

摘要

本文提出一种在端到端短语相关说话人验证系统中利用神经网络建模说话人与会话变异性并能生成似然比的方法。如同联合因子分析,该模型使用绑定隐变量来建模说话人与会话变异性,并对模型部分参数进行最大后验(MAP)自适应。在训练过程中,我们的方法联合估计网络参数以及说话人与信道隐变量的值。这通过一个两步反向传播算法完成:首先更新网络权重与因子载荷矩阵,然后更新隐变量,其梯度通过对相应说话人或会话帧进行聚合来计算,因为这些隐变量是绑定的。网络的最后一层定义为以先前层输出为输入的线性回归概率模型。这一选择的好处在于它能产生似然值,并且可在注册期间通过 MAP 自适应而无需梯度优化。决策基于两个神经网络模型(说话人自适应模型与通用背景模型)输出似然值之比。该方法在 RSR2015 数据库上进行了评估。

关键词

引用

@article{arxiv.1812.11946,
  title  = {Tied Hidden Factors in Neural Networks for End-to-End Speaker Recognition},
  author = {Antonio Miguel and Jorge Llombart and Alfonso Ortega and Eduardo Lleida},
  journal= {arXiv preprint arXiv:1812.11946},
  year   = {2019}
}