中文

FAAG:通过交互式攻击优化实现快速对抗音频生成

声音 2022-02-14 v1 密码学与安全 音频与语音处理

摘要

自动语音识别服务(ASR)继承了深度神经网络易受精心构造对抗样本攻击的弱点。现有方法常因将目标相位添加到整个音频样本而效率低下,导致对计算资源的高需求。本文提出一种名为 FAAG 的新方案,作为一种基于迭代优化的方法,可快速生成目标对抗样本。通过在音频起始部分注入噪声,FAAG 能及时以高成功率生成高质量的对抗音频。具体而言,我们利用音频的 logits 输出将转写中的每个字符映射到音频帧的近似位置。因此,FAAG 仅用 CPU 约两分钟、单 GPU 约十秒即可生成对抗样本,且平均成功率超过 85%。具体而言,在对抗样本生成过程中,FAAG 方法相比基线方法可加速约 60%。此外,我们发现向任何可疑样本追加良性音频可有效防御目标对抗攻击。我们希望该工作能为在计算受限条件下发明新的语音识别对抗攻击铺平道路。

关键词

引用

@article{arxiv.2202.05416,
  title  = {FAAG: Fast Adversarial Audio Generation through Interactive Attack Optimisation},
  author = {Yuantian Miao and Chao Chen and Lei Pan and Jun Zhang and Yang Xiang},
  journal= {arXiv preprint arXiv:2202.05416},
  year   = {2022}
}