中文

基于深度神经网络与分段动态时间规整的文本无关说话人验证

声音 2018-06-27 v1 计算与语言 音频与语音处理

摘要

本文提出一种结合分段动态时间规整(SDTW)与 d-vector 方法的文本无关说话人验证新方法。d-vector 由经训练以区分说话人的前馈深度神经网络生成,被用作特征来执行对齐,从而计算注册语音与测试语音之间的总体距离。我们在 NIST 2008 说话人验证数据集上给出结果,所提方法优于采用 PLDA 分数的常规 i-vector 基线,也优于基于余弦和 PLDA 分数的局部距离 d-vector 方法。此外,与 i-vector/PLDA 基线的分数融合相较两种方法均带来显著增益。

关键词

引用

@article{arxiv.1806.09932,
  title  = {Text-Independent Speaker Verification Based on Deep Neural Networks and Segmental Dynamic Time Warping},
  author = {Mohamed Adel and Mohamed Afify and Akram Gaballah},
  journal= {arXiv preprint arXiv:1806.09932},
  year   = {2018}
}

备注

Submitted to SLT 2018