一种高效且逼近边界的零置信度对抗攻击
机器学习
2019-10-02 v1 机器学习
摘要
白盒对抗攻击主要有两种范式试图施加输入扰动。第一种范式称为固定扰动攻击,在给定扰动水平内构造对抗样本。第二种范式称为零置信度攻击,寻找导致误分类所需的最小扰动,也称为输入特征的边界(margin)。尽管前一种范式已得到较好解决,但后者尚未。现有的零置信度攻击要么引入显著的近似误差,要么过于耗时。因此我们提出 MARGINATTACK,一种能够以更高准确率和效率计算边界的零置信度攻击框架。我们的实验表明,MARGINATTACK 能够计算出比最先进的零置信度攻击更小的边界,并与最先进的固定扰动攻击相匹配。此外,它比目前最准确的零置信度攻击算法 Carlini-Wagner 攻击运行显著更快。
引用
@article{arxiv.1910.00511,
title = {An Efficient and Margin-Approaching Zero-Confidence Adversarial Attack},
author = {Yang Zhang and Shiyu Chang and Mo Yu and Kaizhi Qian},
journal= {arXiv preprint arXiv:1910.00511},
year = {2019}
}