一种面向连续定向多模型攻击的新集成方法
密码学与安全
2019-12-24 v1 机器学习
摘要
众所周知,深度学习模型易受通过对原始输入恶意添加扰动而构造的对抗样本攻击。攻击分为定向攻击与非定向攻击两类,多数研究者往往更关注定向对抗样本。然而,定向攻击成功率低,尤其在面向鲁棒模型或黑盒攻击协议时。此时,非定向攻击成为使AI系统失效的最后机会。因此,本文提出一种新攻击机制:当定向攻击失败时执行非定向攻击。此外,我们旨在为同一任务的多个已部署模型(如图像分类模型)生成单个对抗样本。故此实际应用场景下,我们聚焦于通过将集成模型分为两组——易攻模型与鲁棒模型——来攻击它们。我们以非定向或定向方式交替攻击这两组模型,称之为装袋与堆叠集成(BAST)攻击。BAST攻击可生成同时使多个模型失效的对抗样本:部分模型将该样本分类为目标标签,其余未被成功攻击的模型至少给出错误标签。实验结果表明,在同时考量定向与非定向攻击性能的新定义准则下,所提BAST攻击优于SOTA攻击方法。
引用
@article{arxiv.1912.10833,
title = {A New Ensemble Method for Concessively Targeted Multi-model Attack},
author = {Ziwen He and Wei Wang and Xinsheng Xuan and Jing Dong and Tieniu Tan},
journal= {arXiv preprint arXiv:1912.10833},
year = {2019}
}