通过集成边界逼近的对抗检测
机器学习
2025-01-14 v5 人工智能
密码学与安全
计算机视觉与模式识别
摘要
尽管深度神经网络(DNNs)在许多应用领域有效,却易受攻击。在物体识别中,攻击表现为向图像添加微小扰动,使DNN误分类,而人眼看来毫无差异。对抗攻击催生了自身亦受攻击的防御,攻击/防御策略为DNN的性质提供了重要信息。本文针对求解两类模式识别问题的深度神经网络(DNNs)集成,提出一种检测对抗攻击的新方法。该集成利用Walsh系数组合,Walsh系数能够逼近布尔函数,从而控制决策边界复杂度。本文的假设是:高曲率的决策边界使对抗扰动可被发现,但会改变决策边界的曲率,进而使Walsh系数以不同于干净图像的方式对其逼近。除控制边界复杂度外,这些系数还度量与类标签的相关性,或有助于理解DNN的学习与可迁移性性质。尽管本文实验使用图像,所提的两类集成决策边界建模方法原则上可应用于任何应用领域。
引用
@article{arxiv.2211.10227,
title = {Adversarial Detection by Approximation of Ensemble Boundary},
author = {T. Windeatt},
journal= {arXiv preprint arXiv:2211.10227},
year = {2025}
}
备注
27 pages, 7 figures, 5 tables