对抗方向可迁移性的几何视角
机器学习
2018-11-09 v1 机器学习
摘要
最先进的机器学习模型经常对以对抗方式扰动的输入产生误分类。针对给定输入和特定分类器生成的对抗扰动似乎常对其他输入甚至不同分类器也有效。换言之,对抗扰动似乎在不同输入、模型甚至不同神经网络架构之间发生迁移。本工作中,我们证明在线性分类器和两层 ReLU 网络的背景下,可证明地存在同时为许多分类器和数据点引发对抗扰动的方向。我们表明这些“可迁移对抗方向”对于给定集合的线性分离器必然存在,并且对于从同一分布抽取的独立集上训练的线性分类器将以高概率存在。我们将结果扩展到大类两层 ReLU 网络。我们进一步表明 ReLU 网络的对抗方向可迁移至线性分类器,而反之未必成立,这表明更复杂模型的对抗扰动更可能迁移到其他分类器。我们甚至在更深的 ReLU 网络上对发现进行了实证验证。
引用
@article{arxiv.1811.03531,
title = {A Geometric Perspective on the Transferability of Adversarial Directions},
author = {Zachary Charles and Harrison Rosenberg and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:1811.03531},
year = {2018}
}