语音生物特征安全性:基于说话人验证分数层次贝叶斯建模的外推虚警率
音频与语音处理
2019-11-05 v1 机器学习
声音
机器学习
摘要
自动说话人验证(ASV)技术有多安全?更具体地,给定一特定目标说话人,找到另一个被误接受为该目标的人可能性有多大?该问题可通过在足够大的语料库中研究自然易混淆说话人对来经验性地解决。为此,人们可能期望找到至少一些在 ASV 意义上彼此不可区分的说话人对。在某种程度上,此类目标体现在标准化的 ASV 评估基准中。然而,此类评估基准中的说话人数量仅占所有可能人类声音的一小部分,使得难以在给定的语料库之外外推性能。此外,性能评估中使用的冒名者通常是随机选择的。冒名者一个可能更有意义的定义——至少在安全驱动的 ASV 应用背景下——是相对于给定目标最接近(最易混淆)的其他说话人。我们提出了一种新颖的性能评估框架,通过处理针对任意大规模数据集上最接近冒名者的 ASV 安全性,来解决随机冒名者评估模型的不足和评估语料库规模的限制。该框架允许人们针对由虚拟(采样)说话人组成的任意大规模说话人数据库,预测当前状态下给定 ASV 技术的安全性。作为概念验证,我们分析了两个基于 i-vector 和 x-vector 说话人嵌入(如流行 Kaldi 工具包中所实现)的先进 ASV 系统在近期 VoxCeleb 1 & 2 语料库上的性能。我们发现 i-vector 与 x-vector 系统均无法避免随冒名者数据库规模增大而上升的虚警率。
引用
@article{arxiv.1911.01182,
title = {Voice Biometrics Security: Extrapolating False Alarm Rate via Hierarchical Bayesian Modeling of Speaker Verification Scores},
author = {Alexey Sholokhov and Tomi Kinnunen and Ville Vestman and Kong Aik Lee},
journal= {arXiv preprint arXiv:1911.01182},
year = {2019}
}
备注
Accepted to be published in Computer Speech and Language