深度说话人嵌入的后端选择
声音
2022-04-26 v1 音频与语音处理
摘要
概率线性判别分析(PLDA)曾是早期说话人识别方法(如 i-vector 与 x-vector)主导且必需的后端。然而,随着神经网络与基于边界的损失函数的发展,我们可以获得深度说话人嵌入(DSEs),其具有类间分离度增大、类内距离减小的优势。在此情况下,PLDA 对于这些判别性嵌入似乎不再必要甚至起反作用,且余弦相似度打分(Cos)在某些情形下优于 PLDA。受此启发,本文系统探究如何为深度说话人嵌入选择后端(Cos 或 PLDA),以在不同情形下取得更优性能。通过分析 PLDA 以及从不同段级层数模型中提取的 DSEs 的性质,我们推测:同域情形下 Cos 更优,跨域情形下 PLDA 更优。我们在 VoxCeleb 与 NIST SRE 数据集上于单域/多域训练与同域/跨域测试四种应用情形开展实验,以验证推测并简要解释后端自适应算法为何有效。
引用
@article{arxiv.2204.11403,
title = {Back-ends Selection for Deep Speaker Embeddings},
author = {Zhuo Li and Runqiu Xiao and Zihan Zhang and Zhenduo Zhao and Wenchao Wang and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2204.11403},
year = {2022}
}
备注
submitted to interspeech2022