中文

说话人验证中大间隔嵌入的打分方法:余弦相似度还是 PLDA?

音频与语音处理 2022-04-12 v2 声音

摘要

在训练深度说话人嵌入神经网络时,大间隔 softmax 交叉熵损失的出现逐渐促使说话人验证从参数化后端转向更简单的余弦相似度度量。流行的参数化后端包括概率线性判别分析(PLDA)及其变体。本文研究了导致这种转变的基于间隔的交叉熵损失的性质,并旨在寻找最适合说话人验证的打分后端。此外,我们重新审视了过去广泛使用的预处理技术,并评估了它们在大间隔嵌入上的有效性。在使用各种大间隔 softmax 交叉熵损失训练的最先进 ECAPA-TDNN 网络上的实验表明,说话人内紧凑性大幅提升,使得传统 PLDA 变得多余。在这方面,我们发现约束说话人内协方差矩阵可以提升 PLDA 的性能。在 VoxCeleb-1 和 SITW core-core 测试集上的一系列实验证明,等错误率(EER)降低了 40.8%,最小检测代价(minDCF)降低了 35.1%。它还始终优于余弦打分,EER 和 minDCF 分别降低 10.9% 和 4.9%。

关键词

引用

@article{arxiv.2204.03965,
  title  = {Scoring of Large-Margin Embeddings for Speaker Verification: Cosine or PLDA?},
  author = {Qiongqiong Wang and Kong Aik Lee and Tianchi Liu},
  journal= {arXiv preprint arXiv:2204.03965},
  year   = {2022}
}