中文

SHIELD 在不同威胁模型下的有效性

机器学习 2019-08-06 v2 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

在这篇评估论文中,我们评估 SHIELD 的有效性,SHIELD 是一个发表于 KDD 2018 的、用于抵御图像分类模型对抗攻击的基于压缩的防御框架。此处我们考虑原工作未研究的替代威胁模型,其中我们假设自适应攻击者知晓集成防御方法、防御性预处理以及集成中所用模型的架构与权重。我们定义具有不同威胁程度的场景,并通过改变攻击者可得信息量(从全白盒攻击到原工作中描述的灰盒威胁模型)来经验性分析所提防御。为评估该防御对自适应攻击者的鲁棒性,我们考虑投影梯度下降(PGD)攻击的目标攻击成功率,PGD 是对抗机器学习研究中提出的强基于梯度的对抗攻击。我们还尝试从头训练 SHIELD 集成,这不同于原工作中使用预训练模型进行重训练。我们发现,在全白盒场景下,目标 PGD 攻击对原始 SHIELD 集成的成功率为 64.3%,但如果集成中使用的模型从头训练而非重训练,则该值降至 48.9%。我们的实验进一步揭示,模型被重训练的集成在余弦相似度空间中确实具有更高相关性,而从头训练的模型在全白盒与灰盒场景下更不易受目标攻击。

关键词

引用

@article{arxiv.1902.00541,
  title  = {The Efficacy of SHIELD under Different Threat Models},
  author = {Cory Cornelius and Nilaksh Das and Shang-Tse Chen and Li Chen and Michael E. Kounavis and Duen Horng Chau},
  journal= {arXiv preprint arXiv:1902.00541},
  year   = {2019}
}

备注

Appraisal paper of existing method accepted for oral presentation at KDD LEMINCS 2019