中文

超越$L_p$裁剪:基于均衡的针对ASR的心理声学攻击

密码学与安全 2021-10-27 v1 声音 音频与语音处理

摘要

自动语音识别(ASR)系统将语音转换为文本,可分为两大类:传统型和全端到端型。两类系统均已被证明易受对抗性音频样例的攻击,这些样例在人耳听来无害,却迫使ASR产生恶意转写。在这些攻击中,只有“心理声学”攻击能够利用人类听觉系统的知识来生成具有相对不易察觉扰动的样例。遗憾的是,现有的心理声学攻击仅能应用于传统模型,而对较新的全端到端ASR已失效。本文中,我们提出一种基于均衡的心理声学攻击,可同时利用传统和全端到端ASR。我们针对包括DeepSpeech和Wav2Letter在内的真实世界ASR成功演示了攻击。此外,我们开展了用户研究以验证所提方法产生的可听失真较低。具体而言,100名参与者中有80人投票认为我们所有的攻击音频样例均比现有最先进攻击的噪声更小。由此,我们证明了两类现有ASR流水线均可在攻击音频质量最小退化的情况下被利用。

关键词

引用

@article{arxiv.2110.13250,
  title  = {Beyond $L_p$ clipping: Equalization-based Psychoacoustic Attacks against ASRs},
  author = {Hadi Abdullah and Muhammad Sajidur Rahman and Christian Peeters and Cassidy Gibson and Washington Garcia and Vincent Bindschaedler and Thomas Shrimpton and Patrick Traynor},
  journal= {arXiv preprint arXiv:2110.13250},
  year   = {2021}
}

备注

accepted at ACML 2021