中文

针对最先进说话人识别系统对抗攻击的预处理防御研究

音频与语音处理 2024-10-28 v2 声音

摘要

说话人识别(SR)系统的对抗样本是通过在语音信号中添加精心构造的噪声以使得系统失效,同时对人耳不可感知而生成的。此类攻击带来了严重的安全风险,因此深入探究最先进的 SR 系统在这些攻击下的脆弱程度至关重要。此外,提出能够保护系统免受此类攻击的防御方法更为重要。针对这些问题,本文首先研究了基于 x-vector 的最先进 SR 系统在白盒对抗攻击(即攻击者对系统具有完全了解)下的受影响情况。基于 x-vector 的 SR 系统在文献中常见的白盒对抗攻击下进行了评估,包括快速梯度符号法(FGSM)、基础迭代法(BIM,亦称迭代式 FGSM)、投影梯度下降(PGD)以及 Carlini-Wagner(CW)攻击。为缓解这些攻击,本文提出了四种预处理防御方法。它们在强大的自适应白盒对抗攻击(即攻击者对系统包括防御机制具有完全了解)下进行了评估。这四种预处理防御方法——即随机平滑、DefenseGAN、变分自编码器(VAE)和 Parallel WaveGAN 声码器(PWG)——与对抗训练这一基线防御进行了比较。结论表明,SR 系统在 BIM、PGD 和 CW 攻击下极为脆弱。在所提出的预处理防御中,PWG 结合随机平滑提供了最强的攻击防护,其准确率平均为 93%,而未防御系统为 52%,并且在 L>0.001L_\infty>0.001 的 BIM 攻击和 CW 攻击下绝对提升超过 90%。

关键词

引用

@article{arxiv.2101.08909,
  title  = {Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems},
  author = {Sonal Joshi and Jesús Villalba and Piotr Żelasko and Laureano Moro-Velázquez and Najim Dehak},
  journal= {arXiv preprint arXiv:2101.08909},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication