基于多级池化的深度说话人嵌入学习用于文本无关说话人验证
计算与语言
2019-02-22 v1 声音
音频与语音处理
摘要
本文旨在改进广泛使用的深度说话人嵌入 x-vector 模型。我们提出以下改进:(1) 采用同时使用时延神经网络(TDNN)与长短期记忆神经网络(LSTM)的混合神经网络结构,以在不同层级生成互补的说话人信息;(2) 多级池化策略,从 TDNN 与 LSTM 层共同收集说话人信息;(3) 在说话人嵌入提取层上的正则化方案,使提取的嵌入适于后续融合步骤。这些改进的协同效果在 NIST SRE 2016 评估测试(等错误率降低19%)与 SRE 2018 开发测试(等错误率降低9%)上得到体现,且在这两项测试集上相较 x-vector 基线,检测代价函数(DCF)分数均降低逾10%。
引用
@article{arxiv.1902.07821,
title = {Deep Speaker Embedding Learning with Multi-Level Pooling for Text-Independent Speaker Verification},
author = {Yun Tang and Guohong Ding and Jing Huang and Xiaodong He and Bowen Zhou},
journal= {arXiv preprint arXiv:1902.07821},
year = {2019}
}
备注
Accepted by ICASSP2019