基于最小不确定性的深度神经网络对抗样本检测
机器学习
2020-10-19 v2 密码学与安全
机器学习
摘要
尽管深度神经网络(DNNs)在诸多领域取得了前所未有的性能,但即便存在微小的对抗扰动,其在安全关键环境中的使用也受到严重限制。本工作提出了一种基于最小不确定性度量的随机化方法来检测此类扰动,该方法依赖于在 DNN 推理阶段对隐藏层进行采样。受贝叶斯不确定性估计方法的启发,采样概率被设计为可有效检测对抗性损坏的输入。作为模块化组件,该新颖的对抗样本检测器可由任何预训练 DNN 便捷地使用,且无需额外训练开销。选择每层采样哪些单元需要量化 DNN 输出不确定性的量,其中总体不确定性以其逐层分量表示——这也促进了可扩展性。随后通过逐层最小化不确定性度量来求得采样概率,从而引出一个新颖的凸优化问题,该问题存在具有超线性收敛速度的精确求解器。通过简化目标函数,还开发了低复杂度近似求解器。除有价值的见解外,这些近似将新方法与时下最先进的随机化对抗检测器联系起来。通过与竞争替代方案的广泛测试(涵盖不同强度级别的多种对抗攻击类型),凸显了所提检测器在新颖性方面的有效性。
引用
@article{arxiv.1904.02841,
title = {Minimum Uncertainty Based Detection of Adversaries in Deep Neural Networks},
author = {Fatemeh Sheikholeslami and Swayambhoo Jain and Georgios B. Giannakis},
journal= {arXiv preprint arXiv:1904.02841},
year = {2020}
}