对抗防御自适应攻击的自动化发现
机器学习
2021-10-28 v3 计算机视觉与模式识别
机器学习
摘要
对抗防御的可靠评估是一项具有挑战性的任务,目前局限于专家手动制作利用防御内部机制的攻击,或基于固定攻击集合的方法,而这些方法可能对该特定防御均无效。我们的关键观察是,自适应攻击由可复用的构建块组成,这些构建块可在搜索空间中形式化,并用于自动发现未知防御的攻击。我们在24个对抗防御上评估了我们的方法,并显示它优于AutoAttack(当前用于对抗防御可靠评估的最先进工具):我们的工具通过为10个模型多生成3.0%-50.8%的对抗样本发现了显著更强的攻击,同时为其余模型获得了略强或相似强度的攻击。
引用
@article{arxiv.2102.11860,
title = {Automated Discovery of Adaptive Attacks on Adversarial Defenses},
author = {Chengyuan Yao and Pavol Bielik and Petar Tsankov and Martin Vechev},
journal= {arXiv preprint arXiv:2102.11860},
year = {2021}
}
备注
21 pages, 3 figures, 10 tables. NeurIPS2021