SentiNet:检测针对深度学习系统的局部通用攻击
密码学与安全
2020-05-12 v4
摘要
SentiNet 是一种针对神经网络局部通用攻击的新型检测框架。这些攻击将对抗性噪声限制在图像的连续区域中,并且可针对不同图像重复使用——这些约束被证明有助于生成物理可实现的攻击。与大多数其他对抗检测工作不同,SentiNet 不需要训练模型或在检测前预知攻击。我们的方法具有吸引力,因为攻击特定防御必须考虑大量可能的机制和攻击向量。通过利用神经网络对攻击的易感性,并使用来自模型可解释性和目标检测的技术作为检测机制,SentiNet 将模型的弱点转化为优势。我们在三种不同攻击上展示了 SentiNet 的有效性——即数据投毒攻击、特洛伊化网络和对抗补丁(包括物理可实现的攻击)——并表明我们的防御能够对这三种威胁均取得极具竞争力的性能指标。最后,我们表明 SentiNet 对强自适应对手具有鲁棒性,这些对手专门构建针对 SentiNet 架构组件的对抗补丁。
引用
@article{arxiv.1812.00292,
title = {SentiNet: Detecting Localized Universal Attacks Against Deep Learning Systems},
author = {Edward Chou and Florian Tramèr and Giancarlo Pellegrino},
journal= {arXiv preprint arXiv:1812.00292},
year = {2020}
}
备注
Deep Learning and Security Workshop (DLS)