中文

面向说话人识别的音频对抗样本理解与缓解

声音 2022-06-08 v1 人工智能 密码学与安全 机器学习 音频与语音处理

摘要

说话人识别系统(SRSs)近来被证明易受对抗攻击,引发了重大的安全担忧。在本工作中,我们系统地研究了基于变换与对抗训练的防御方法以保护 SRSs。根据 SRSs 的特性,我们提出了 22 种多样的变换,并使用 7 种近期有前景的对抗攻击(4 种白盒、3 种黑盒)在说话人识别上对其进行了全面评估。在审慎遵循防御评估最佳实践的前提下,我们分析了这些变换抵御自适应攻击的能力。我们还评估并理解了它们在结合对抗训练时针对自适应攻击的有效性。我们的研究提供了大量有用的见解与发现,其中许多是新的或与图像和语音识别领域的结论不一致,例如,可变与恒定码率语音压缩表现不同,且一些不可微变换仍能抵御当前有前景的规避技术(这些技术在图像领域通常表现良好)。我们表明,所提出的新型特征级变换结合对抗训练在完全白盒设定下相比单独对抗训练相当有效,例如,将准确率提升 13.62%、将攻击代价提高两个数量级,而其他变换未必能改善整体防御能力。本工作进一步启发了该领域的研究方向。我们还发布了评估平台 SPEAKERGUARD 以促进进一步研究。

关键词

引用

@article{arxiv.2206.03393,
  title  = {Towards Understanding and Mitigating Audio Adversarial Examples for Speaker Recognition},
  author = {Guangke Chen and Zhe Zhao and Fu Song and Sen Chen and Lingling Fan and Feng Wang and Jiashui Wang},
  journal= {arXiv preprint arXiv:2206.03393},
  year   = {2022}
}