中文

具有联合贝叶斯模型结构的孪生神经网络用于说话人确认

音频与语音处理 2021-04-08 v1 机器学习 声音

摘要

生成式概率模型被广泛用于说话人确认(SV)。然而,生成式模型缺乏判别性特征选择能力。作为一种假设检验,SV 可被视为二分类任务,可设计为具有判别训练的孪生神经网络(SiamNN)。然而,在多数 SiamNN 的判别训练中,仅考虑成对样本距离的分布,而忽略了样本联合分布中的额外判别信息。本文中,我们提出一种考虑样本联合分布的新型 SiamNN。首先基于联合贝叶斯(JB)生成式模型表述样本联合分布,然后设计具有全连接层的 SiamNN 以近似 JB 模型中使用的分解仿射变换。通过使用 JB 模型学习到的模型参数初始化 SiamNN,我们进一步以成对样本作为二分类判别任务训练模型参数用于 SV。我们在 speakers in the wild(SITW)和 VoxCeleb 语料上进行了 SV 实验。实验结果表明,与 SOTA SV 模型相比,我们所提模型大幅提升了性能。

关键词

引用

@article{arxiv.2104.03004,
  title  = {Siamese Neural Network with Joint Bayesian Model Structure for Speaker Verification},
  author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
  journal= {arXiv preprint arXiv:2104.03004},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2101.03329