中文

音频领域神经网络对抗攻击:利用主成分

机器学习 2021-01-14 v3 密码学与安全 机器学习

摘要

对抗攻击是与原始输入相似但被故意篡改的输入。当今广泛使用的语音转文本神经网络容易将对抗攻击误分类。在本研究中,我们首先通过改动 Common Voice 数据集中的波形,考察针对性对抗攻击的存在性。我们通过连接时序分类损失函数(Connectionist Temporal Classification Loss Function)构造对抗波形,并攻击由 Mozilla 实现的语音转文本神经网络 DeepSpeech。在我们构造的 25 个对抗波形上,DeepSpeech 实现了 100% 的对抗成功率(即 DeepSpeech 成功分类数为零)。其次,我们研究使用 PCA 作为抵御对抗攻击的防御机制。我们对这 25 个攻击样本应用 PCA 进行降维,并用 DeepSpeech 进行测试。我们观察到 DeepSpeech 的成功分类数为零,这表明 PCA 在音频领域并非良好的防御机制。最后,我们不再将 PCA 用作防御机制,而是在仅有极少对抗知识的黑盒设定下,利用 PCA 构造对抗输入。在不知晓模型、参数或权重的情况下,我们对 Common Voice 数据集中的样本应用 PCA 来构造对抗攻击,并在以 DeepSpeech 测试时再次于黑盒设定下取得 100% 的对抗成功率。我们还尝试了攻击过程中导致分类所需的不同比例的主成分。在所有情况下,攻击方均告成功。

关键词

引用

@article{arxiv.2007.07001,
  title  = {Adversarial Attacks against Neural Networks in Audio Domain: Exploiting Principal Components},
  author = {Ken Alparslan and Yigit Alparslan and Matthew Burlick},
  journal= {arXiv preprint arXiv:2007.07001},
  year   = {2021}
}

备注

8 pages, 14 figures, fixed typos, enumerated equations, fixed equation (4) latex error, clarified author contributions via footnote