中文

通过集成边界逼近的对抗检测

机器学习 2025-01-14 v5 人工智能 密码学与安全 计算机视觉与模式识别

摘要

尽管深度神经网络(DNNs)在许多应用领域有效,却易受攻击。在物体识别中,攻击表现为向图像添加微小扰动,使DNN误分类,而人眼看来毫无差异。对抗攻击催生了自身亦受攻击的防御,攻击/防御策略为DNN的性质提供了重要信息。本文针对求解两类模式识别问题的深度神经网络(DNNs)集成,提出一种检测对抗攻击的新方法。该集成利用Walsh系数组合,Walsh系数能够逼近布尔函数,从而控制决策边界复杂度。本文的假设是:高曲率的决策边界使对抗扰动可被发现,但会改变决策边界的曲率,进而使Walsh系数以不同于干净图像的方式对其逼近。除控制边界复杂度外,这些系数还度量与类标签的相关性,或有助于理解DNN的学习与可迁移性性质。尽管本文实验使用图像,所提的两类集成决策边界建模方法原则上可应用于任何应用领域。

关键词

引用

@article{arxiv.2211.10227,
  title  = {Adversarial Detection by Approximation of Ensemble Boundary},
  author = {T. Windeatt},
  journal= {arXiv preprint arXiv:2211.10227},
  year   = {2025}
}

备注

27 pages, 7 figures, 5 tables