可证明对抗防御的规模化
机器学习
2018-11-26 v2 人工智能
最优化与控制
机器学习
摘要
近期工作已开发出学习对范数有界对抗扰动具可证明鲁棒性的深度网络分类器之方法;然而,这些方法目前仅可能对相对较小的前馈网络可行。本文为将这些方法扩展至显著更大模型,沿三个主要方向拓展先前工作。首先,我们提出将此类训练流程扩展至更通用网络(含跳跃连接如 ResNets 与通用非线性)的技术;该方案完全模块化,可自动实现(类比自动微分)。其次,在 对抗扰动与 ReLU 非线性网络的特定情形下,我们采用非线性随机投影训练,其随隐藏单元数线性缩放(先前方法为二次缩放)。第三,我们展示如何通过级联模型进一步改善鲁棒误差。在 MNIST 与 CIFAR 数据集上,我们所训练分类器在可证明鲁棒对抗误差界上大幅改进最优水平:MNIST(含 扰动 )从 5.8% 至 3.1%,CIFAR(含 扰动 )从 80% 至 36.4%。文中所有实验代码见于 https://github.com/locuslab/convex_adversarial/。
引用
@article{arxiv.1805.12514,
title = {Scaling provable adversarial defenses},
author = {Eric Wong and Frank R. Schmidt and Jan Hendrik Metzen and J. Zico Kolter},
journal= {arXiv preprint arXiv:1805.12514},
year = {2018}
}