中文

用于文本无关说话人验证的深度说话人特征学习

声音 2017-05-11 v1 计算与语言 机器学习

摘要

最近深度神经网络(DNNs)已被用于学习说话人特征。然而,所学特征的质量不够好,因此在应用于说话人验证时,必须使用复杂的后端模型(神经的或概率的)来解决残差不确定性,就像使用原始特征一样。本文提出一种卷积时延深度神经网络结构(CT-DNN)用于说话人特征学习。我们在Fisher数据库上的实验结果表明,该CT-DNN能产生高质量说话人特征:即使仅使用单个特征(0.3秒包括上下文),等错误率(EER)可低至7.68%。这有效证实了说话人特质在很大程度上是确定性的短时属性而非长时分布模式,因此可从仅数十帧中提取。

关键词

引用

@article{arxiv.1705.03670,
  title  = {Deep Speaker Feature Learning for Text-independent Speaker Verification},
  author = {Lantian Li and Yixiang Chen and Ying Shi and Zhiyuan Tang and Dong Wang},
  journal= {arXiv preprint arXiv:1705.03670},
  year   = {2017}
}

备注

deep neural networks, speaker verification, speaker feature