中文

关于描述对抗攻击的度量指标有效性的探讨

机器学习 2023-01-31 v1

摘要

对抗防御自然是根据其容忍对抗攻击的能力来评估的。为了测试防御,人们构造了多样的对抗攻击,这些攻击通常根据其规避能力和 L0、L1、L2 和 Linf 范数来描述。我们质疑规避能力和 L 范数是否是最有效的信息,用以声称防御已在具有代表性的攻击集上进行了测试。为此,我们从最先进的成果中选取图像质量度量指标,并搜索图像扰动与可检测性之间的相关性。我们观察到,仅计算 L 范数很少是更优的解决方案。我们观察到,在对抗图像上计算出的已识别度量指标与该图像上检测器的输出之间存在强相关性,以至于它们可以以约 0.94 的准确率预测检测器的响应。此外,我们观察到度量指标可以基于相似的扰动和相似的可检测性对攻击进行分类。这表明有可能重新审视评估检测器的方法,即引入额外的度量指标以确保所选攻击数据集具有代表性。

关键词

引用

@article{arxiv.2301.13028,
  title  = {On the Efficacy of Metrics to Describe Adversarial Attacks},
  author = {Tommaso Puccetti and Tommaso Zoppi and Andrea Ceccarelli},
  journal= {arXiv preprint arXiv:2301.13028},
  year   = {2023}
}

备注

7 pages, selected for presentation at AICS