中文

通过心理声学隐藏对自动语音识别系统发起对抗攻击

密码学与安全 2018-10-31 v2 声音 音频与语音处理

摘要

语音接口正被广泛接受为多种设备的输入方法。这一发展由自动语音识别(ASR)的快速改进所驱动,其在许多任务中表现已与人类听觉相当。这些改进基于作为 ASR 计算核心的 DNN 的持续演进。然而,近期研究结果表明 DNN 易受对抗扰动影响,使攻击者能强制转录出恶意输出。在本文中,我们引入一种基于心理声学隐藏的新型对抗样本。我们的攻击利用了基于 DNN 的 ASR 系统的特性,其中我们通过一个额外的反向传播步骤扩展了原始分析过程。我们利用该反向传播学习输入信号对抗扰动的自由度,即我们应用心理声学模型并在人类感知阈值以下操纵声学信号。为了进一步最小化扰动的可感知性,我们使用强制对齐来寻找原始音频样本与恶意目标转录之间的最佳时间对齐。这些扩展使我们能够将任意音频输入嵌入恶意语音命令,随后由 ASR 系统转录,且音频信号仍与原始信号几乎无法区分。在实验评估中,我们攻击了最先进的语音识别系统 Kaldi,并确定了针对不同输入类型性能最佳的参数与分析设置。我们的结果表明,在十秒音频文件计算开销少于两分钟的情况下,我们在多达 98% 的案例中成功。基于用户研究,我们发现我们的目标转录均不为人类听者所听见,而他们仍以不变准确度理解原始语音内容。

关键词

引用

@article{arxiv.1808.05665,
  title  = {Adversarial Attacks Against Automatic Speech Recognition Systems via Psychoacoustic Hiding},
  author = {Lea Schönherr and Katharina Kohls and Steffen Zeiler and Thorsten Holz and Dorothea Kolossa},
  journal= {arXiv preprint arXiv:1808.05665},
  year   = {2018}
}