中文

用于对抗攻击检测的先验网络

机器学习 2018-12-08 v1 密码学与安全 机器学习

摘要

对抗样本被视为人工智能在安全关键应用(如金融、自动驾驶车辆控制和医疗应用)中的一个严重问题。尽管大量工作已使系统对这些攻击的鲁棒性增强,系统仍易受精心构造的攻击。为解决此问题,已提出若干对抗攻击检测方法。然而,系统仍可能易受专门设计以规避这些检测方法的对抗样本的影响。近期一种表现出良好性能的检测方案基于由蒙特卡洛 dropout 集成推导的不确定性估计。先验网络(Prior Networks)作为一种估计预测不确定性的新方法,已在一系列任务上展示出优于蒙特卡洛 dropout 的性能。该方法的一个优势是先验网络的行为可被显式调节,例如,在无训练数据样本的区域预测高不确定性。在本工作中,先验网络以类似于蒙特卡洛 dropout 的方式利用不确定性度量应用于对抗攻击检测。基于从 DNN 和蒙特卡洛 dropout 集成导出的不确定性度量的检测被用作基线。先验网络在白盒与黑盒配置的一系列对抗攻击检测中均显著优于这些基线方法。即使对抗攻击是在完全知晓检测机制的情况下构造的,也表明成功生成对抗样本极具挑战性。

关键词

引用

@article{arxiv.1812.02575,
  title  = {Prior Networks for Detection of Adversarial Attacks},
  author = {Andrey Malinin and Mark Gales},
  journal= {arXiv preprint arXiv:1812.02575},
  year   = {2018}
}