中文

基于神经网超级向量优化ROC曲线下面积用于文本相关说话人验证

声音 2019-05-01 v2 机器学习 音频与语音处理 机器学习

摘要

本文探讨了两种基于深度神经网络提升文本相关说话人验证系统性能的技术。首先,我们提出一种通用对齐机制,以保持每个短语的时间结构并获得包含说话人与短语信息的超级向量,因为二者对文本相关验证均至关重要。如我们所展示的,可使用不同的对齐技术替代全局平均池化,从而显著提升性能。此外,我们还提出了一种新颖的后端方法,通过优化曲线下面积(AUC)来训练用于检测任务的神经网络,作为常用三元组损失函数的替代方案,从而使系统端到端,且代价函数接近我们期望的性能度量。如实验部分所示,该方法提升了系统性能,因为我们基于AUC近似(aAUC)的三元组神经网络学会了区分来自同一身份的样本对与不同身份的样本对。在RSR2015-Part I数据库上测试了用于生成超级向量的不同对齐技术以及新的后端方法,相较于使用全局平均池化提取超级向量并采用简单后端或三元组损失训练的相似规模网络,取得了具有竞争力的结果。

关键词

引用

@article{arxiv.1901.11332,
  title  = {Optimization of the Area Under the ROC Curve using Neural Network Supervectors for Text-Dependent Speaker Verification},
  author = {Victoria Mingote and Antonio Miguel and Alfonso Ortega and Eduardo Lleida},
  journal= {arXiv preprint arXiv:1901.11332},
  year   = {2019}
}