中文

机器学习中对抗样本的有坑流形模型

机器学习 2022-06-02 v2 密码学与安全 机器学习

摘要

深度神经网络在输入发生微小扰动时表现出的极端脆弱性,于2013年被多个研究小组独立发现。然而,尽管付出了巨大努力,这些对抗样本仍然是一种缺乏简单可检验解释的反直觉现象。在本文中,我们提出了一种关于训练过程中类间决策边界如何演化的新概念框架,称之为有坑流形模型(Dimpled Manifold Model)。具体而言,我们证明了训练分为两个截然不同的阶段。第一阶段是一个(通常较快的)贴合过程,其中初始随机取向的决策边界变得非常接近包含全部训练样本的低维图像流形。接下来是(通常较慢的)起坑阶段,它在决策边界上产生浅凸起,将其移动到训练样本的正确一侧。该框架简单地解释了为何对抗样本存在、为何其扰动具有极小的范数,以及为何它们看起来像随机噪声而非目标类别。该解释还被用来表明,一个用错误标注图像进行对抗训练的网络可能仍正确分类大多数测试图像,并表明对抗训练的主要效果仅仅是加深决策边界上生成的坑。最后,我们讨论并展示了流形上(on-manifold)与流形外(off-manifold)对抗扰动非常不同的性质。我们描述了大量实验的结果,这些实验使用低维合成数据集和高维自然数据集,有力地支持了这一新模型。

关键词

引用

@article{arxiv.2106.10151,
  title  = {The Dimpled Manifold Model of Adversarial Examples in Machine Learning},
  author = {Adi Shamir and Odelia Melamed and Oriel BenShmuel},
  journal= {arXiv preprint arXiv:2106.10151},
  year   = {2022}
}