中文

用于说话人验证的高斯约束训练

音频与语音处理 2019-02-19 v2 计算与语言 声音

摘要

神经模型,特别是 d-vector 与 x-vector 架构,已在许多说话人验证任务上取得最先进性能。然而,这些神经模型的两个潜在问题值得深入研究。首先,两种模型都存在“信息泄漏”,即部分参与模型训练的参数在推理时会被丢弃,例如用作分类器的层。其次,这些模型未对所得说话人向量的分布进行约束。这种“无约束分布”可能降低后续打分组件(如 PLDA)的性能。本文提出一种高斯约束训练方法,其(1)丢弃参数化分类器,(2)强制所得说话人向量的分布为高斯分布。我们在 VoxCeleb 与 SITW 数据库上的实验表明,该新训练方法产生了更具代表性与规整性的说话人嵌入,带来一致的性能提升。

关键词

引用

@article{arxiv.1811.03258,
  title  = {Gaussian-Constrained training for speaker verification},
  author = {Lantian Li and Zhiyuan Tang and Ying Shi and Dong Wang},
  journal= {arXiv preprint arXiv:1811.03258},
  year   = {2019}
}