中文

HOLMES:使用多检测器检测对抗样本

人工智能 2024-05-31 v1

摘要

深度神经网络(DNN)容易被添加到图像中的一些不可察觉但有目的的噪声欺骗,并错误分类。先前的防御工作大多集中于重新训练模型或检测噪声,但要么成功率有限,要么被新的对抗样本攻击。我们不关注对抗图像或DNN模型内部,而是观察到不同算法生成的对抗样本可以根据DNN的输出(logits)来识别。Logit可以作为外部特征来训练检测器。然后,我们提出HOLMES(分层组织轻量级多检测器系统)通过检测潜在的对抗样本来增强DNN,以最小化它们在实际中可能带来的威胁。HOLMES能够以高精度和低假阳性率区分来自多种攻击的未见过的对抗样本,甚至比单一检测器系统在自适应模型中表现更好。为确保HOLMES中检测器的多样性和随机性,我们使用两种方法:为每个标签训练专用检测器,以及使用top-k logits训练检测器。我们有效且廉价的策略既不修改原始DNN模型,也不需要其内部参数。HOLMES不仅兼容各种学习模型(甚至仅通过外部API),而且可以与其他防御方法互补,实现更高的检测率(也可能完全保护系统免受各种对抗样本的攻击)。

关键词

引用

@article{arxiv.2405.19956,
  title  = {HOLMES: to Detect Adversarial Examples with Multiple Detectors},
  author = {Jing Wen},
  journal= {arXiv preprint arXiv:2405.19956},
  year   = {2024}
}