SirenAttack:面向端到端声学系统生成对抗音频的攻击方法
密码学与安全
2019-07-25 v2
摘要
尽管基于深度学习的声学系统极为流行,但其本质上易受对抗攻击,即经过恶意构造的音频会触发目标系统产生错误行为。本文提出 SirenAttack,一类用于生成对抗音频的新型攻击。与现有攻击相比,SirenAttack 具有一组显著特征:(i) 通用性——能够在白盒与黑盒设定下欺骗一系列端到端声学系统;(ii) 有效性——能够生成被目标声学系统识别为特定短语的对抗音频;(iii) 隐蔽性——能够生成与人类感知中良性音频无法区分的对抗音频。我们在若干最先进的基于深度学习的声学系统(包括语音指令识别、说话人识别与声音事件分类)上对 SirenAttack 进行了实证评估,结果表明其通用性、有效性与隐蔽性。例如,在 IEMOCAP 数据集上针对 ResNet18 模型实现了 99.45% 的攻击成功率,同时生成的对抗音频也被包括 Google Cloud Speech、Microsoft Bing Voice 和 IBM Speech-to-Text 在内的多个流行 ASR 平台误识别。我们进一步评估了三种潜在的防御方法以缓解此类攻击,包括对抗训练、音频降采样与移动平均滤波,这为后续研究指明了有前景的方向。
引用
@article{arxiv.1901.07846,
title = {SirenAttack: Generating Adversarial Audio for End-to-End Acoustic Systems},
author = {Tianyu Du and Shouling Ji and Jinfeng Li and Qinchen Gu and Ting Wang and Raheem Beyah},
journal= {arXiv preprint arXiv:1901.07846},
year = {2019}
}
备注
The experimental results were not up to our expectation