持久分类:一种研究数据稳定性与对抗样本的新方法
机器学习
2024-04-15 v1
摘要
关于分类问题中对抗样本的存在性有诸多假设。这些假设包括数据的高维性、感兴趣的数据流形在周围空间中的高余维数,以及机器学习模型的结构可能促使分类器在数据点附近形成决策边界。本文提出了一种研究对抗样本的新框架,该框架不直接依赖于到决策边界的距离。与平滑分类器文献类似,我们定义一个(自然或对抗)数据点为 -稳定的,如果对于在给定标准差 的高斯邻域内采样的点,其分类结果相同的概率至少为 。我们重点研究自然点和对抗点的插值路径上持久性度量的差异。我们表明,在 MNIST 和 ImageNet 数据集上,大型神经网络中的对抗样本的持久性显著低于自然样本。我们通过测量插值点相对于决策边界的角度,将这种持久性的缺乏与决策边界几何联系起来。最后,我们通过开发流形对齐梯度度量,并展示在训练中加入该度量后所能实现的鲁棒性提升,将该方法与鲁棒性联系起来。
引用
@article{arxiv.2404.08069,
title = {Persistent Classification: A New Approach to Stability of Data and Adversarial Examples},
author = {Brian Bell and Michael Geyer and David Glickenstein and Keaton Hamm and Carlos Scheidegger and Amanda Fernandez and Juston Moore},
journal= {arXiv preprint arXiv:2404.08069},
year = {2024}
}