中文

用于文本无关说话人确认的生成式 x-vector

音频与语音处理 2018-09-19 v1 机器学习 声音 机器学习

摘要

使用深度神经网络嵌入(即所谓 x-vector 系统)的说话人确认(SV)系统因其优于 i-vector 系统的良好性能而日益流行。这些系统的融合通过兼具判别训练的 x-vector 与捕捉不同说话人特征的生成式 i-vector 而带来性能提升。本文提出一种融合 i-vector 与 x-vector 互补信息的新方法,称为生成式 x-vector。生成式 x-vector 利用从背景数据的 i-vector 与 x-vector 表示中学习到的变换模型。采用典型相关分析推导该变换模型,随后用于将注册段与测试段的标准 x-vector 变换为相应的生成式 x-vector。在 NIST SRE 2010 数据集上进行的 SV 实验表明,使用生成式 x-vector 的系统比基线的 i-vector 与 x-vector 系统性能明显更好。此外,对于长时长语句,生成式 x-vector 优于 i-vector 与 x-vector 系统的融合,而在短时长语句上取得相当的结果。

关键词

引用

@article{arxiv.1809.06798,
  title  = {Generative x-vectors for text-independent speaker verification},
  author = {Longting Xu and Rohan Kumar Das and Emre Yılmaz and Jichen Yang and Haizhou Li},
  journal= {arXiv preprint arXiv:1809.06798},
  year   = {2018}
}

备注

Accepted for publication at SLT 2018