概率模型中成功对抗样本的稳健性界:来自高斯过程的启示
机器学习
2025-03-20 v2 密码学与安全
机器学习
摘要
对抗样本 (AE) 是一种机器学习攻击方法,通过向数据添加不可察觉的扰动来诱导误分类。在本文中,我们基于高斯过程 (GP) 分类(一种概率推理模型)研究了成功 AE 概率的上界。我们证明了成功 AE 攻击概率的一个新上界,该上界取决于 AE 的扰动范数、GP 中使用的核函数,以及训练数据集中具有不同标签的最近样本对之间的距离。令人惊讶的是,该上界的确定与样本数据集的分布无关。我们表明,使用 ImageNet 的实验证实了我们的理论结果。此外,我们还表明改变核函数的参数会引起成功 AE 概率上界的变化。
引用
@article{arxiv.2403.01896,
title = {Robustness bounds on the successful adversarial examples in probabilistic models: Implications from Gaussian processes},
author = {Hiroaki Maeshima and Akira Otsuka},
journal= {arXiv preprint arXiv:2403.01896},
year = {2025}
}