对抗样本的生成需要指数级错位
机器学习
2026-03-12 v2 无序系统与神经网络
神经元与认知
机器学习
摘要
对抗样本——对人类而言不可察觉的输入扰动,却能欺骗神经网络——仍是机器学习中顽固的失效模式,也是一个神秘现象。为阐明其本质,我们定义并分析了网络对某类概念的感知流形(PM)——即由网络对该类输入中被可靠归属的输入构成的空间。我们发现,神经网络 PM 的维度数目是人类自然概念维度数的多个数量级。这表明机器与人类之间存在指数级错位,因为体积通常随维度指数增长,这意味着机器对概念的可信归属输入数量远超人类。进一步,这为对抗样本的自然几何假设提供了依据:由于网络 PM 填满输入空间的大区域,任何输入都非常接近任何类概念的 PM。我们的假设因此表明,除非实现机器与人类 PM 的维度对齐,否则无法实现对抗鲁棒性,因此对此提出了强烈预测:robust accuracy 和到任何 PM 的距离应与 PM 维度呈负相关。我们在 18 个不同鲁棒性网络上验证了这些预测。关键的是,我们发现即便是最鲁棒的网络仍然指数级错位,只有那些 PM 维度接近人类概念的少数 PM 才 exhibits alignment to human perception。我们的结果将 alignment 和对抗样本领域联系起来,表明机器 PM 的高维诅咒是对抗鲁棒性的主要障碍。
引用
@article{arxiv.2603.03507,
title = {Solving adversarial examples requires solving exponential misalignment},
author = {Alessandro Salvatore and Stanislav Fort and Surya Ganguli},
journal= {arXiv preprint arXiv:2603.03507},
year = {2026}
}