中文

将说话人嵌入估计的不确定性引入说话人验证

音频与语音处理 2023-02-24 v1 声音

摘要

在不同条件下录制的语音片段,即便使用同一神经网络提取,其嵌入估计的置信度(即不确定性)也各不相同。本文旨在将 xi-vector 网络前端产生的不确定性估计与概率线性判别分析 (PLDA) 后端打分相结合用于说话人验证。为此,我们从逐帧精度推导至嵌入空间的后验协方差矩阵,用以度量不确定性。我们提出了一种带不确定性传播的 PLDA 打分对数似然比函数。我们还提议以长度缩放技术替代长度归一化预处理技术,以在后端中应用不确定性传播。在 VoxCeleb-1、SITW 测试集以及域不匹配的 CNCeleb1-E 集上的实验结果表明,所提技术有效,等错误率降低 14.5%–41.3%,最小检测代价函数降低 4.6%–25.3%。

关键词

引用

@article{arxiv.2302.11763,
  title  = {Incorporating Uncertainty from Speaker Embedding Estimation to Speaker Verification},
  author = {Qiongqiong Wang and Kong Aik Lee and Tianchi Liu},
  journal= {arXiv preprint arXiv:2302.11763},
  year   = {2023}
}

备注

Accepted in ICASSP 2023 conference