中文

面向说话人向量的深度归一化

音频与语音处理 2020-11-03 v2 机器学习 声音 机器学习

摘要

深度说话人嵌入在说话人识别任务中已展现出最先进的性能。然而,该方法的一个潜在问题是,由深度嵌入模型导出的说话人向量对于每个说话人往往是非高斯的,且不同说话人的分布是非齐次的。这些不规则分布会严重影响说话人识别性能,尤其是在流行的 PLDA 打分方法中,其假设齐次高斯分布。本文主张深度说话人向量需要深度归一化,并基于一种新颖的判别归一化流(DNF)模型提出了一种深度归一化方法。我们利用广泛使用的 SITW 与 CNCeleb 语料库通过实验证明了所提方法的有效性。在这些实验中,基于 DNF 的归一化带来了显著的性能提升,并在域外测试中展现出强大的泛化能力。

关键词

引用

@article{arxiv.2004.04095,
  title  = {Deep Normalization for Speaker Vectors},
  author = {Yunqi Cai and Lantian Li and Dong Wang and Andrew Abel},
  journal= {arXiv preprint arXiv:2004.04095},
  year   = {2020}
}