SHIELD 在不同威胁模型下的有效性
机器学习
2019-08-06 v2 人工智能
密码学与安全
计算机视觉与模式识别
机器学习
摘要
在这篇评估论文中,我们评估 SHIELD 的有效性,SHIELD 是一个发表于 KDD 2018 的、用于抵御图像分类模型对抗攻击的基于压缩的防御框架。此处我们考虑原工作未研究的替代威胁模型,其中我们假设自适应攻击者知晓集成防御方法、防御性预处理以及集成中所用模型的架构与权重。我们定义具有不同威胁程度的场景,并通过改变攻击者可得信息量(从全白盒攻击到原工作中描述的灰盒威胁模型)来经验性分析所提防御。为评估该防御对自适应攻击者的鲁棒性,我们考虑投影梯度下降(PGD)攻击的目标攻击成功率,PGD 是对抗机器学习研究中提出的强基于梯度的对抗攻击。我们还尝试从头训练 SHIELD 集成,这不同于原工作中使用预训练模型进行重训练。我们发现,在全白盒场景下,目标 PGD 攻击对原始 SHIELD 集成的成功率为 64.3%,但如果集成中使用的模型从头训练而非重训练,则该值降至 48.9%。我们的实验进一步揭示,模型被重训练的集成在余弦相似度空间中确实具有更高相关性,而从头训练的模型在全白盒与灰盒场景下更不易受目标攻击。
引用
@article{arxiv.1902.00541,
title = {The Efficacy of SHIELD under Different Threat Models},
author = {Cory Cornelius and Nilaksh Das and Shang-Tse Chen and Li Chen and Michael E. Kounavis and Duen Horng Chau},
journal= {arXiv preprint arXiv:1902.00541},
year = {2019}
}
备注
Appraisal paper of existing method accepted for oral presentation at KDD LEMINCS 2019