用于文本无关说话人确认的生成式 x-vector
音频与语音处理
2018-09-19 v1 机器学习
声音
机器学习
摘要
使用深度神经网络嵌入(即所谓 x-vector 系统)的说话人确认(SV)系统因其优于 i-vector 系统的良好性能而日益流行。这些系统的融合通过兼具判别训练的 x-vector 与捕捉不同说话人特征的生成式 i-vector 而带来性能提升。本文提出一种融合 i-vector 与 x-vector 互补信息的新方法,称为生成式 x-vector。生成式 x-vector 利用从背景数据的 i-vector 与 x-vector 表示中学习到的变换模型。采用典型相关分析推导该变换模型,随后用于将注册段与测试段的标准 x-vector 变换为相应的生成式 x-vector。在 NIST SRE 2010 数据集上进行的 SV 实验表明,使用生成式 x-vector 的系统比基线的 i-vector 与 x-vector 系统性能明显更好。此外,对于长时长语句,生成式 x-vector 优于 i-vector 与 x-vector 系统的融合,而在短时长语句上取得相当的结果。
引用
@article{arxiv.1809.06798,
title = {Generative x-vectors for text-independent speaker verification},
author = {Longting Xu and Rohan Kumar Das and Emre Yılmaz and Jichen Yang and Haizhou Li},
journal= {arXiv preprint arXiv:1809.06798},
year = {2018}
}
备注
Accepted for publication at SLT 2018