中文

用于自动说话人验证欺骗检测的集成模型

音频与语音处理 2019-07-05 v2 声音

摘要

检测自动说话人验证(ASV)系统的欺骗尝试具有挑战性,尤其当仅使用单一建模方法时。为增强鲁棒性,我们同时使用深度神经网络与传统机器学习模型,并通过逻辑回归将它们组合为集成模型。这些模型经训练用于检测作为 ASV 欺骗与对策挑战赛 2019 一部分发布的数据集上的逻辑访问(LA)与物理访问(PA)攻击。我们提出了数据集划分方案,以确保训练与验证期间存在不同攻击类型,从而提升系统鲁棒性。我们的集成模型在两类攻击上均优于所有单一模型及挑战赛基线。我们探究了 PA 数据集上某些模型大幅优于其他模型的原因,发现数据集中 spoofed 录音末尾往往比真实录音具有更长的静音段。通过去除这些静音段,PA 任务变得更具挑战性,我们最佳单一模型的串联检测代价函数(t-DCF)从 0.1672 升至 0.5018,等错误率(EER)在开发集上从 5.98% 增至 19.8%。

关键词

引用

@article{arxiv.1904.04589,
  title  = {Ensemble Models for Spoofing Detection in Automatic Speaker Verification},
  author = {Bhusan Chettri and Daniel Stoller and Veronica Morfi and Marco A. Martínez Ramírez and Emmanouil Benetos and Bob L. Sturm},
  journal= {arXiv preprint arXiv:1904.04589},
  year   = {2019}
}

备注

Accepted at Interspeech 2019, Graz, Austria