中文

邪恶双胞胎之 tale:对抗样本与投毒模型的较量

机器学习 2020-11-24 v3 密码学与安全 机器学习

摘要

尽管深度学习系统在众多领域取得了巨大成功,其本质上易受两类操纵的影响:对抗样本——精心构造以欺骗目标深度神经网络(DNN)模型的恶意样本;以及投毒模型——在预定义输入上表现异常的恶意伪造DNN。虽然先前工作已并行深入研究了这两类攻击向量,但对其基本联系仍缺乏理解:两类攻击向量之间的动态交互是什么?此类交互对优化现有攻击有何启示?针对增强型攻击的潜在对策是什么?回答这些关键问题对于评估和缓解现实部署中DNN的整体漏洞至关重要。在此,我们通过在统一框架内对两类攻击向量进行首次系统性研究,朝此目标迈出坚实一步。具体而言,(i)我们开发了一种联合优化对抗样本与投毒模型的新攻击模型;(ii)借助分析与经验证据,我们揭示两类攻击向量之间存在引人入胜的“相互强化”效应——利用其一显著放大另一者的有效性;(iii)我们证明此类效应为攻击者增强利用两类向量的现有攻击(如后门攻击)提供了广阔的设计空间,例如针对各类检测方法最大化攻击规避性;(iv)最后,我们讨论针对此类优化攻击的潜在对策及其技术挑战,指出若干有前景的研究方向。

关键词

引用

@article{arxiv.1911.01559,
  title  = {A Tale of Evil Twins: Adversarial Inputs versus Poisoned Models},
  author = {Ren Pang and Hua Shen and Xinyang Zhang and Shouling Ji and Yevgeniy Vorobeychik and Xiapu Luo and Alex Liu and Ting Wang},
  journal= {arXiv preprint arXiv:1911.01559},
  year   = {2020}
}

备注

Accepted as a full paper at ACM CCS 2020