中文

DistriBlock:利用输出分布特征识别对抗音频样本

声音 2024-11-07 v8 密码学与安全 机器学习 音频与语音处理

摘要

对抗攻击可误导自动语音识别(ASR)系统预测任意目标文本,从而构成明确的安全威胁。为防御此类攻击,我们提出DistriBlock,一种适用于任何在每个时间步预测输出词元概率分布的ASR系统的高效检测策略。我们度量该分布的一组特征:输出概率的中位数、最大值和最小值,分布的熵,以及与后续时间步分布相对的Kullback-Leibler和Jensen-Shannon散度。随后,通过利用在良性与对抗数据上观察到的特征,我们应用二分类器,包括简单的基于阈值的分类、此类分类器的集成以及神经网络。通过对不同最先进ASR系统和语言数据集的广泛分析,我们展示了该方法卓越的性能:区分目标对抗样本与干净及含噪数据的接收者操作特征曲线下面积均值分别为99%和97%。为评估方法的鲁棒性,我们展示能够规避DistriBlock的自适应对抗样本噪声明显更大,这使其更易通过滤波检测,并为维持系统鲁棒性提供了另一途径。

关键词

引用

@article{arxiv.2305.17000,
  title  = {DistriBlock: Identifying adversarial audio samples by leveraging characteristics of the output distribution},
  author = {Matías Pizarro and Dorothea Kolossa and Asja Fischer},
  journal= {arXiv preprint arXiv:2305.17000},
  year   = {2024}
}

备注

Available at: https://proceedings.mlr.press/v244/pizarro24a.html