x-vector 系统为何漏检目标说话人?VoxCeleb 数据上声学失配对目标得分的影响
音频与语音处理
2020-08-12 v1 计算机与社会
声音
摘要
现代自动说话人验证(ASV)严重依赖通过深度神经网络实现的机器学习。这些黑盒的输出往往难以解释。顺应可解释机器学习的趋势,我们对 ASV 检测得分与注册和测试语音声学失配之间的依赖关系进行建模。我们旨在识别能够解释目标说话人漏检(错误拒绝)的失配因素。我们使用所选声学特征一阶和二阶统计量的距离作为线性混合效应模型中的预测变量,而标准 Kaldi x-vector 系统构成我们的 ASV 黑盒。我们在 VoxCeleb 数据上的结果表明,最显著的失配因素是 F0 均值,其次是与会话共振峰频率相关的失配。我们的发现表明 x-vector 系统缺乏说话人内部变化的鲁棒性。
引用
@article{arxiv.2008.04578,
title = {Why Did the x-Vector System Miss a Target Speaker? Impact of Acoustic Mismatch Upon Target Score on VoxCeleb Data},
author = {Rosa González Hautamäki and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2008.04578},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020