中文

基于自动化复制/粘贴攻击的深度神经网络诊断

机器学习 2023-05-08 v3 人工智能 密码学与安全

摘要

本文考虑帮助人类对深度神经网络(DNNs)进行可扩展监督的问题。对抗样本可通过揭示 DNN 的弱点而发挥作用,但它们难以解释或从中得出可操作结论。一些先前工作提出使用人类可解释的对抗攻击,包括复制/粘贴攻击,即一张自然图像被粘贴到另一张中会导致意外的误分类。我们在此基础上做出两点贡献。首先,我们提出使用嵌入搜索自然对抗特征(SNAFUE),其提供了一种全自动寻找复制/粘贴攻击的方法。其次,我们使用 SNAFUE 对 ImageNet 分类器进行红队测试。我们复现了先前工作中的复制/粘贴攻击,并发现了数百个其他易于描述的漏洞,且全程无需人类参与。代码可在 https://github.com/thestephencasper/snafue 获取。

关键词

引用

@article{arxiv.2211.10024,
  title  = {Diagnostics for Deep Neural Networks with Automated Copy/Paste Attacks},
  author = {Stephen Casper and Kaivalya Hariharan and Dylan Hadfield-Menell},
  journal= {arXiv preprint arXiv:2211.10024},
  year   = {2023}
}

备注

Best paper award at the NeurIPS 2022 ML Safety Workshop -- https://neurips2022.mlsafety.org/