对抗样本不是错误,它是叠加效应
机器学习
2025-09-16 v2
摘要
对抗样本——带有不可感知扰动且能误导神经网络的输入——是深度学习中最令人困惑的现象之一,尽管已有近十年的研究。尽管提出了众多防御和解释方法,但仍未就其根本机制达成共识。一个较少探讨的假设是,叠加效应——来自机制可解释性概念——可能是主要贡献因素,甚至是根本原因。我们提出了四项证据支持这一假设,大大扩展了 Elhage 等人(2022)的先行论证:(1)叠加效应可理论上解释一系列对抗现象,(2)在玩具模型中,干预叠加效应可控制鲁棒性,(3)在玩具模型中,干预鲁棒性(通过对抗训练)可控制叠加效应,(4)在 ResNet18 中,干预鲁棒性(通过对抗训练)可控制叠加效应。
引用
@article{arxiv.2508.17456,
title = {Adversarial Examples Are Not Bugs, They Are Superposition},
author = {Liv Gorton and Owen Lewis},
journal= {arXiv preprint arXiv:2508.17456},
year = {2025}
}