中文

神经网络的 Wasserstein 分布鲁棒性

机器学习 2023-06-19 v1 计算机视觉与模式识别 最优化与控制 概率论

摘要

深度神经网络已知易受对抗攻击(AA)影响。对于图像识别任务,这意味着原始图像的微小扰动可导致其被误分类。此类攻击的设计以及相应的对抗训练方法正受到深入研究。我们利用 Wasserstein 分布鲁棒优化(DRO)技术重新表述该问题,并借助近期 DRO 敏感性分析的见解取得新的贡献。我们考虑了一组分布威胁模型。不同于假设每个输入数据点扰动具有一致界的传统逐点攻击,分布威胁模型允许攻击者以非一致方式扰动输入。我们将这些更一般的攻击与样本外性能及 Knightian 不确定性问题相联系。为评估神经网络的分布鲁棒性,我们提出了一种一阶 AA 算法及其多步版本。我们的攻击算法将快速梯度符号法(FGSM)与投影梯度下降(PGD)作为特例包含在内。此外,我们给出了针对分布威胁模型的对抗准确率的新的渐近估计。该界计算迅速且为一阶精确,即便对逐点 AA 也提供了新的见解。它亦自然给出样本外性能保证。我们在 CIFAR-10 数据集上使用 RobustBench 上的 DNNs 进行数值实验以阐明我们的理论结果。我们的代码见于 https://github.com/JanObloj/W-DRO-Adversarial-Methods。

关键词

引用

@article{arxiv.2306.09844,
  title  = {Wasserstein distributional robustness of neural networks},
  author = {Xingjian Bai and Guangyi He and Yifan Jiang and Jan Obloj},
  journal= {arXiv preprint arXiv:2306.09844},
  year   = {2023}
}

备注

23 pages, 6 figures, 8 tables