中文

语音识别系统的对抗攻击与防御

音频与语音处理 2024-10-28 v1 密码学与安全 声音

摘要

机器学习系统在我们生活中的无处不在,使得研究其漏洞及相应对策成为必要。特别地,我们研究了针对自动语音识别(ASR)系统的对抗攻击与防御的有效性。我们选择了两个 ASR 模型——一个被充分研究的 DeepSpeech 模型和一个较新的 Espresso 框架 Transformer 编码器-解码器模型。我们研究了两种威胁模型:一种拒绝服务场景,其中使用快速梯度符号方法(FGSM)或弱投影梯度下降(PGD)攻击来降低模型的词错误率(WER);以及一种定向场景,其中更强的不可感知攻击迫使系统识别特定短语。我们发现所研究的 ASR 系统之间的攻击可迁移性有限。为了防御模型,我们使用了两种预处理防御:随机平滑和基于 WaveGAN 的声码器,并发现它们显著提高了模型的对抗鲁棒性。我们表明 WaveGAN 声码器可以成为针对 ASR 系统对抗攻击的有效对策——即使它与 ASR 一起受到联合攻击,目标短语的词错误率仍然很高。

关键词

引用

@article{arxiv.2103.17122,
  title  = {Adversarial Attacks and Defenses for Speech Recognition Systems},
  author = {Piotr Żelasko and Sonal Joshi and Yiwen Shao and Jesus Villalba and Jan Trmal and Najim Dehak and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2103.17122},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication