深度残差神经网络用于音频欺骗检测
机器学习
2019-07-11 v1
摘要
当前最先进的语音合成和语音转换模型能够生成与真实人类语音在感知上无法区分的合成语音。这些方法对自动说话人验证(ASV)系统构成了威胁。此外,攻击者使用扬声器重放先前录制的真实人类语音的重放攻击也是可能的。我们提出了针对ASVSpoof2019竞赛的解决方案,该竞赛旨在开发能够区分欺骗攻击和真实语音的对抗系统。我们的模型受到残差卷积网络在许多分类任务中成功的启发。我们构建了三种残差卷积神经网络的变体,它们接受不同的输入特征表示(MFCC、对数幅度STFT和CQCC)。我们比较了模型变体与竞赛基线模型所达到的性能。在逻辑访问场景中,我们的模型融合在开发集上的t-DCF成本为零且等错误率(EER)为零。在评估集上,与基线算法相比,我们的模型融合将t-DCF和EER提高了25%。针对物理访问重放攻击,我们的模型融合在评估集上分别将基线算法的t-DCF和EER分数提高了71%和75%。
引用
@article{arxiv.1907.00501,
title = {Deep Residual Neural Networks for Audio Spoofing Detection},
author = {Moustafa Alzantot and Ziqi Wang and Mani B. Srivastava},
journal= {arXiv preprint arXiv:1907.00501},
year = {2019}
}
备注
This article has been removed by arXiv administrators because the submitter did not have the rights to agree to the license at the time of submission