用于检测针对自动语音识别的音频对抗样本的噪声泛洪方法
声音
2019-02-26 v1 计算与语言
密码学与安全
机器学习
音频与语音处理
摘要
神经模型在各种任务中得到了广泛使用,并已成为许多工业系统的关键组成部分。尽管它们有效且极为流行,但并非没有可被利用的缺陷。最初应用于计算机视觉系统,对抗样本的生成是一个对图像施加看似难以察觉的扰动、以诱导基于深度学习的分类器误分类该图像的过程。由于近期语音处理的趋势,这已成为语音识别模型中一个显著的问题。2017年末,一种攻击被证明对Speech Commands分类模型相当有效。有限词汇量的语音分类器(如Speech Commands模型)在各种应用中使用相当频繁,特别是在电话语境中管理自动话务员方面。因此,该攻击产生的对抗样本可能带来现实后果。虽然先前抵御这些对抗样本的工作研究了使用音频预处理来削弱或扭曲对抗噪声,本工作探索了用随机噪声泛洪音频信号特定频带以检测对抗样本的思路。这种泛洪技术受计算机视觉中工作的启发,且不需要重新训练或修改模型,其建立在语音分类器对自然噪声相对鲁棒这一理念之上。一种结合5个不同频带对信号泛洪噪声的联合防御在音频领域优于其他现有防御,以91.8%的精确率和93.5%的召回率检测对抗样本。
引用
@article{arxiv.1812.10061,
title = {Noise Flooding for Detecting Audio Adversarial Examples Against Automatic Speech Recognition},
author = {Krishan Rajaratnam and Jugal Kalita},
journal= {arXiv preprint arXiv:1812.10061},
year = {2019}
}
备注
Orally presented at the 18th IEEE International Symposium on Signal Processing and Information Technology (ISSPIT) in Louisville, Kentucky, USA, December 2018. 5 pages, 2 figures