基于自适应阈值的包容性说话人验证
声音
2021-11-11 v1 人工智能
机器学习
摘要
在商业应用中使用基于说话人验证(SV)的系统时,无论客户的性别、年龄或种族如何,提供包容性的体验十分重要。在本文中,我们分析了性别和年龄对 SV 的影响,发现对于不同性别和年龄组所需的共同错误接受率(FAR),其错误拒绝率(FRR)因性别和年龄组而异。为在所需 FAR 下优化所有用户的 FRR,我们提出了一种针对 SV 的上下文(如性别、年龄)自适应阈值框架。对于许多实际应用,上下文可作为先验信息获得。我们还提出了一种级联的性别/年龄检测模型,以在缺乏此类先验信息时算法性地推导上下文。我们通过实验表明,我们的上下文自适应阈值方法在构建更高效的包容性 SV 系统中是有效的。具体而言,我们表明在 voxceleb1 测试集上,通过使用性别特定阈值,我们可以降低特定性别在所需 FAR 下的 FRR。在 OGI 儿童语音语料库上的类似分析表明,通过使用年龄特定阈值,我们可以显著降低某些年龄组在所需 FAR 下的 FRR。
引用
@article{arxiv.2111.05501,
title = {Inclusive Speaker Verification with Adaptive thresholding},
author = {Navdeep Jain and Hongcheng Wang},
journal= {arXiv preprint arXiv:2111.05501},
year = {2021}
}