中文

对用于捕获对抗攻击的 Honeypots 防御的部分攻破

密码学与安全 2020-09-24 v1 机器学习

摘要

近期一种防御提出向神经网络中注入"honeypots"以检测对抗攻击。我们通过将检测真正率降至 0\% 且检测 AUC 降至 0.02,并保持原始失真界限,攻破了该防御的基线版本。原论文作者在他们的 CCS'20 论文中已修正该防御以缓解此类攻击。为促进进一步研究,我们在 https://nicholas.carlini.com/code/ccs_honeypot_break 发布了我们攻击过程完整的 2.5 小时逐键屏幕录制。

关键词

引用

@article{arxiv.2009.10975,
  title  = {A Partial Break of the Honeypots Defense to Catch Adversarial Attacks},
  author = {Nicholas Carlini},
  journal= {arXiv preprint arXiv:2009.10975},
  year   = {2020}
}