具有联合贝叶斯模型结构的孪生神经网络用于说话人确认
音频与语音处理
2021-04-08 v1 机器学习
声音
摘要
生成式概率模型被广泛用于说话人确认(SV)。然而,生成式模型缺乏判别性特征选择能力。作为一种假设检验,SV 可被视为二分类任务,可设计为具有判别训练的孪生神经网络(SiamNN)。然而,在多数 SiamNN 的判别训练中,仅考虑成对样本距离的分布,而忽略了样本联合分布中的额外判别信息。本文中,我们提出一种考虑样本联合分布的新型 SiamNN。首先基于联合贝叶斯(JB)生成式模型表述样本联合分布,然后设计具有全连接层的 SiamNN 以近似 JB 模型中使用的分解仿射变换。通过使用 JB 模型学习到的模型参数初始化 SiamNN,我们进一步以成对样本作为二分类判别任务训练模型参数用于 SV。我们在 speakers in the wild(SITW)和 VoxCeleb 语料上进行了 SV 实验。实验结果表明,与 SOTA SV 模型相比,我们所提模型大幅提升了性能。
引用
@article{arxiv.2104.03004,
title = {Siamese Neural Network with Joint Bayesian Model Structure for Speaker Verification},
author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
journal= {arXiv preprint arXiv:2104.03004},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2101.03329