基于深度神经网络与分段动态时间规整的文本无关说话人验证
声音
2018-06-27 v1 计算与语言
音频与语音处理
摘要
本文提出一种结合分段动态时间规整(SDTW)与 d-vector 方法的文本无关说话人验证新方法。d-vector 由经训练以区分说话人的前馈深度神经网络生成,被用作特征来执行对齐,从而计算注册语音与测试语音之间的总体距离。我们在 NIST 2008 说话人验证数据集上给出结果,所提方法优于采用 PLDA 分数的常规 i-vector 基线,也优于基于余弦和 PLDA 分数的局部距离 d-vector 方法。此外,与 i-vector/PLDA 基线的分数融合相较两种方法均带来显著增益。
引用
@article{arxiv.1806.09932,
title = {Text-Independent Speaker Verification Based on Deep Neural Networks and Segmental Dynamic Time Warping},
author = {Mohamed Adel and Mohamed Afify and Akram Gaballah},
journal= {arXiv preprint arXiv:1806.09932},
year = {2018}
}
备注
Submitted to SLT 2018