中文

对抗样本不是错误,它是叠加效应

机器学习 2025-09-16 v2

摘要

对抗样本——带有不可感知扰动且能误导神经网络的输入——是深度学习中最令人困惑的现象之一,尽管已有近十年的研究。尽管提出了众多防御和解释方法,但仍未就其根本机制达成共识。一个较少探讨的假设是,叠加效应——来自机制可解释性概念——可能是主要贡献因素,甚至是根本原因。我们提出了四项证据支持这一假设,大大扩展了 Elhage 等人(2022)的先行论证:(1)叠加效应可理论上解释一系列对抗现象,(2)在玩具模型中,干预叠加效应可控制鲁棒性,(3)在玩具模型中,干预鲁棒性(通过对抗训练)可控制叠加效应,(4)在 ResNet18 中,干预鲁棒性(通过对抗训练)可控制叠加效应。

关键词

引用

@article{arxiv.2508.17456,
  title  = {Adversarial Examples Are Not Bugs, They Are Superposition},
  author = {Liv Gorton and Owen Lewis},
  journal= {arXiv preprint arXiv:2508.17456},
  year   = {2025}
}