中文

将生成模型与判别学习框架耦合用于说话人确认

音频与语音处理 2021-11-25 v2 声音

摘要

说话人确认(SV)任务是判断一段语音是否由目标说话人或冒名说话人所说。大多数研究中,基于说话人特征的生成概率模型估计对数似然比(LLR)分数,并与阈值比较以做出决策。然而,生成模型通常关注个体特征分布,不具备判别性特征选择能力,且易被干扰特征分散注意力。SV 可被表述为二分类判别任务,可应用基于神经网络的判别学习。在判别学习中,可在标签监督帮助下去除干扰特征。但判别学习更关注分类边界,易对训练集过拟合,可能导致在测试集上泛化性差。因此,我们提出一种混合学习框架,即将联合贝叶斯(JB)生成模型结构与参数和用于 SV 的神经判别学习框架相耦合。构建了一个双分支孪生神经网络,其全连接层与 JB 模型中使用的分解仿射变换相耦合。JB 模型中的 LLR 分数估计根据判别学习框架中的距离度量来表述。通过使用 JB 模型的生成式学习模型参数初始化双分支神经网络,我们将成对样本作为二分类判别任务来训练模型参数。此外,设计了 SV 中基于最小经验贝叶斯风险的直接评估度量,并作为目标函数集成到判别学习中。我们在 Speakers in the wild 和 Voxceleb 上进行了 SV 实验。实验结果表明,与最先进的 SV 模型相比,我们提出的模型大幅提升了性能。

关键词

引用

@article{arxiv.2101.03329,
  title  = {Coupling a generative model with a discriminative learning framework for speaker verification},
  author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
  journal= {arXiv preprint arXiv:2101.03329},
  year   = {2021}
}