评估 ImageNet 上的对抗攻击:关于误分类类别的现实检视
计算机视觉与模式识别
2021-11-23 v1 密码学与安全
机器学习
摘要
尽管 ImageNet 最初是作为计算机视觉领域性能基准的数据集被提出,它也促成了多种其他研究工作。对抗机器学习便是其中之一,其利用欺骗性输入来误导模型做出错误预测。为评估对抗机器学习领域的攻击与防御,ImageNet 仍是最常用的数据集之一。然而,尚未被研究的一个主题是对抗样本被误分类到的类别的性质。本文利用 ImageNet 类别层级并对上述类别相对于对抗样本未受扰动来源的位置进行度量,对这些误分类类别做了详细分析。我们发现,实现模型间对抗可迁移性的对抗样本中有 被误分类到底层源图像预测出的前 5 类中的某一类。我们还发现,很大一部分无目标误分类实际上是被误分类到语义相似的类别中。基于这些发现,我们讨论了在评估无目标对抗成功时需要考虑 ImageNet 类别层级的必要性。此外,我们倡导未来的研究工作纳入类别信息。
引用
@article{arxiv.2111.11056,
title = {Evaluating Adversarial Attacks on ImageNet: A Reality Check on Misclassification Classes},
author = {Utku Ozbulak and Maura Pintor and Arnout Van Messem and Wesley De Neve},
journal= {arXiv preprint arXiv:2111.11056},
year = {2021}
}
备注
Accepted for publication in 35th Conference on Neural Information Processing Systems (NeurIPS 2021), Workshop on ImageNet: Past,Present, and Future