中文

针对 $\ell_0$ 有界对抗攻击的对抗训练泛化性质

机器学习 2024-02-07 v1 密码学与安全

摘要

我们广泛观察到神经网络容易受到导致错误分类的输入微小加性扰动的影响。在本文中,我们聚焦于 0\ell_0 有界对抗攻击,并旨在从理论上刻画一类重要的截断分类器在对抗训练下的性能。在 0\ell_0 对抗设置下,此类分类器在经验上以及在高斯混合模型理论上都显示出强大的性能。本文的主要贡献是证明了在 0\ell_0 有界对抗扰动下,二分类设置的一个与分布无关的新型泛化界。在此设置下推导泛化界面临两个主要挑战:(i) 高度非线性的截断内积;(ii) 由于对抗训练导致的在 0\ell_0 球上的最大化是非凸且高度非光滑的。为应对这些挑战,我们开发了新的编码技术来界定截断假设类的组合维度。

关键词

引用

@article{arxiv.2402.03576,
  title  = {Generalization Properties of Adversarial Training for $\ell_0$-Bounded Adversarial Attacks},
  author = {Payam Delgosha and Hamed Hassani and Ramtin Pedarsani},
  journal= {arXiv preprint arXiv:2402.03576},
  year   = {2024}
}