中文

针对语音与说话人识别系统的实用隐藏语音攻击

密码学与安全 2019-04-12 v1 机器学习 声音 音频与语音处理

摘要

语音处理系统(VPSes)现已广泛部署,通过应用机器学习的最新进展,其准确性得到了显著提升。然而,对抗性机器学习同样取得了进展,并已被用于证明 VPSes 容易受到隐藏命令注入的攻击——即被噪声掩盖的音频能被 VPS 正确识别,但人类无法识别。不过,此类攻击通常高度依赖于特定机器学习模型的白盒知识,且受限于特定的麦克风和扬声器,导致其在不同声学硬件平台上的适用性(因而其实用性)受限。在本文中,我们打破了这些依赖关系,通过模型无关(黑盒)攻击使隐藏命令攻击更具实用性,该攻击利用了 VPSes 常用的信号处理算法的知识来生成输入机器学习系统的数据。具体而言,我们利用了多个源音频样本在经过声学特征提取算法(如 FFTs)转换后具有相似特征向量这一事实。我们开发了四类产生不可理解音频的扰动,并针对 12 个机器学习模型(包括 7 个专有模型,如 Google Speech API、Bing Speech API、IBM Speech API、Azure Speaker API 等)进行了测试,并展示了对所有目标的成功攻击。此外,我们在多种硬件配置中成功使用了恶意生成的音频样本,证明了其在模型和真实系统中的有效性。借此,我们证明了音频信号处理的特定领域知识是生成成功隐藏语音命令攻击的一种实用手段。

关键词

引用

@article{arxiv.1904.05734,
  title  = {Practical Hidden Voice Attacks against Speech and Speaker Recognition Systems},
  author = {Hadi Abdullah and Washington Garcia and Christian Peeters and Patrick Traynor and Kevin R. B. Butler and Joseph Wilson},
  journal= {arXiv preprint arXiv:1904.05734},
  year   = {2019}
}