听“无恶”,见“Kenansville”:针对语音识别与声纹识别系统的高效可迁移黑盒攻击
密码学与安全
2019-10-14 v1 机器学习
声音
音频与语音处理
摘要
自动语音识别和声纹识别系统正被部署于广泛应用之中,从为缺乏传统接口的设备提供控制机制,到对话的自动转写与用户认证。许多此类应用具有显著的安全与隐私考量。我们开发了在最优系统中强制误转写与误识别的攻击,且对人类理解的影响极小。现代系统的处理流程由信号预处理和特征提取步骤组成,其输出被送入机器学习模型。已有工作聚焦于模型,利用白盒知识定制特定模型的攻击。我们关注模型之前的流程阶段,这些阶段(与模型不同)在各系统间十分相似。因此,我们的攻击是黑盒且可迁移的,并且通过仅修改少量音频帧即可证明实现高达100%的误转写与误识别率。我们通过Amazon Mechanical Turk开展研究,表明人类对常规音频与扰动音频的感知无统计学显著差异。我们的发现表明,模型可能学习了人类受试者通常感知不到但对模型精度至关重要的语音方面。我们还发现某些英语音素(尤其是元音)对我们的攻击明显更易感。我们展示了攻击在蜂窝网络上也有效,其中信号因转码、抖动和丢包而退化。
引用
@article{arxiv.1910.05262,
title = {Hear "No Evil", See "Kenansville": Efficient and Transferable Black-Box Attacks on Speech Recognition and Voice Identification Systems},
author = {Hadi Abdullah and Muhammad Sajidur Rahman and Washington Garcia and Logan Blue and Kevin Warren and Anurag Swarnim Yadav and Tom Shrimpton and Patrick Traynor},
journal= {arXiv preprint arXiv:1910.05262},
year = {2019}
}