中文

IBM说话人识别系统:近期进展与错误分析

计算与语言 2016-05-06 v1 声音 机器学习

摘要

我们介绍了IBM说话人识别系统在对话语音上的近期进展及错误分析。对我们系统有贡献的一些关键进展包括:在i-vector空间中使用最近邻判别分析(NDA)方法(而非LDA)进行会话间变异补偿;应用从自动语音识别(ASR)系统导出的说话人与信道自适应特征用于说话人识别;以及使用具有极大量输出单元(约10k senones)的DNN声学模型来计算i-vector估计过程中所需的帧级软对齐。我们在NIST 2010 SRE扩展核心条件(C1-C9)以及10秒-10秒条件下评估了这些技术。据我们所知,我们的系统所取得的结果代表了迄今为止在这些条件下发表的最佳性能。例如,在扩展tel-tel条件(C5)下,系统实现了0.59%的EER(等错误率)。为了进一步理解剩余错误(在C5上),我们检查了与低分目标试验相关的录音,其中为问题录音/试验识别了各种问题。有趣的是,观察到修正病态录音不仅改善了目标试验的分数,也改善了非目标试验的分数。

关键词

引用

@article{arxiv.1605.01635,
  title  = {The IBM Speaker Recognition System: Recent Advances and Error Analysis},
  author = {Seyed Omid Sadjadi and Jason Pelecanos and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:1605.01635},
  year   = {2016}
}

备注

submitted to INTERSPEECH 2016. arXiv admin note: substantial text overlap with arXiv:1602.07291