中文

论对抗攻击的可逆性

机器学习 2022-06-03 v1 人工智能 密码学与安全

摘要

对抗攻击通过扰动修改图像,改变分类器的预测。这些被修改的图像称为对抗样本,暴露了深度神经网络分类器的脆弱性。本文中,我们研究原始图像与其对应对抗样本所预测类别之间映射的可预测性。该可预测性关乎还原原始预测从而逆转所诱导误分类的可能性。我们将此性质称为对抗攻击的可逆性,并将可逆性量化为还原对抗样本原始类别或真实类别的准确率。我们提出一种利用既有分类结果集合来逆转对抗攻击对分类器影响的方法。我们分析了基准分类器上 SOTA 对抗攻击的可逆性,并讨论了影响可逆性的因素。

关键词

引用

@article{arxiv.2206.00772,
  title  = {On the reversibility of adversarial attacks},
  author = {Chau Yi Li and Ricardo Sánchez-Matilla and Ali Shahin Shamsabadi and Riccardo Mazzon and Andrea Cavallaro},
  journal= {arXiv preprint arXiv:2206.00772},
  year   = {2022}
}