中文

迈向鲁棒的音频欺骗检测:传统特征与学习特征的详细比较

声音 2019-06-20 v2 密码学与安全 机器学习 多媒体 机器学习

摘要

自动说话人验证如同其他生物识别系统一样,易受欺骗攻击。攻击者仅需录制说话人验证系统真实用户的几分钟语音,便可开发多种可能骗过此类系统的欺骗攻击。利用录音中存在的音频线索检测这些攻击是一项重要挑战。大多数现有欺骗检测系统依赖于已知所采用的欺骗技术。本研究旨在克服该限制,通过考察对不同重放欺骗类型具有泛化能力的鲁棒音频特征(包括传统特征及通过自编码器学习的特征)。此外,我们详细说明了建立最先进音频特征检测、前处理与后处理的所有必要步骤,使(非音频专家的)机器学习研究者也能实现此类系统。最后,我们在“真实场景外”的ASVspoof 2017数据集上,以广泛多样且不同组合的人工提取与机器学习的音频特征评估了鲁棒重放说话人检测系统的性能。该数据集包含多种新型欺骗配置。由于我们的重点是考察哪些特征可确保鲁棒性,系统基于传统的高斯混合模型-通用背景模型。随后我们系统性地研究了各特征集的相对贡献。分别基于已知音频特征与机器学习特征的融合模型性能相当,等错误率(EER)为12。最终性能最佳的模型为包含已知与机器学习特征的混合模型,EER达10.8,从而揭示了开发鲁棒欺骗预测模型时融合两类特征的重要性。

关键词

引用

@article{arxiv.1905.12439,
  title  = {Towards robust audio spoofing detection: a detailed comparison of traditional and learned features},
  author = {Balamurali BT and Kin Wah Edward Lin and Simon Lui and Jer-Ming Chen and Dorien Herremans},
  journal= {arXiv preprint arXiv:1905.12439},
  year   = {2019}
}