中文

Catch Me If You Can:基于频率掩蔽的自动语音识别黑盒对抗攻击

声音 2022-04-13 v2 计算与语言 软件工程 音频与语音处理

摘要

自动语音识别(ASR)模型十分普遍,尤其在语音导航与家电语音控制应用中。ASR的计算核心是深度神经网络(DNN),已被证明易受对抗扰动影响,易被攻击者恶意利用以生成错误输出。为协助测试ASR的安全性与鲁棒性,我们提出可生成黑盒(与DNN无关)、非定向对抗攻击的技术,这些攻击可跨ASR移植。这与现有聚焦于耗时且缺乏可移植性的白盒定向攻击的工作形成对比。我们的技术通过心理声学模型操纵音频信号,使音频扰动低于人类感知阈值,从而生成人类听不出差异的对抗攻击。我们使用三个流行ASR与两个输入音频数据集,以输出转录的词错率(WER)、与原始音频的相似度、在不同ASR上的攻击成功率以及防御系统的检测分数等指标评估技术的可移植性与有效性。我们发现我们的对抗攻击可跨ASR移植,不易被最先进防御系统检测,且在听起来与原始音频相似的同时输出转录有显著差异。

关键词

引用

@article{arxiv.2112.01821,
  title  = {Catch Me If You Can: Blackbox Adversarial Attacks on Automatic Speech Recognition using Frequency Masking},
  author = {Xiaoliang Wu and Ajitha Rajan},
  journal= {arXiv preprint arXiv:2112.01821},
  year   = {2022}
}

备注

11 pages, 7 figures and 3 tables