基于最大高斯性训练的深层说话人向量归一化
声音
2020-11-02 v1 机器学习
音频与语音处理
摘要
深层说话人嵌入代表了说话人识别的最先进的技术。该方法的一个关键问题是所得的深层说话人向量往往分布不规则。在先前的研究中,我们提出了一种基于新型判别归一化流(DNF)模型的深层归一化方法,该方法将各个说话人的分布变换为同质高斯分布。这种归一化被证明是有效的,但尽管取得了显著成功,我们通过实验发现,DNF模型产生的潜码通常既非同质也非高斯,尽管模型作了如此假设。在本文中,我们认为该问题主要归因于DNF模型的最大似然(ML)训练准则,其旨在最大化观测的似然,而不一定改善潜码的高斯性。因此我们提出一种新的最大高斯性(MG)训练方法,直接最大化潜码的高斯性。我们在SITW和CNCeleb两个数据集上的实验表明,我们新的MG训练方法能比先前的ML训练取得好得多的性能,并展现出改进的域泛化能力,特别是在余弦打分方面。
引用
@article{arxiv.2010.16148,
title = {Deep Speaker Vector Normalization with Maximum Gaussianality Training},
author = {Yunqi Cai and Lantian Li and Dong Wang and Andrew Abel},
journal= {arXiv preprint arXiv:2010.16148},
year = {2020}
}