通过原则性对抗训练证明某些分布鲁棒性
机器学习
2020-05-04 v5 机器学习
摘要
神经网络易受对抗样本攻击,研究者已提出许多启发式攻击与防御机制。我们通过分布鲁棒优化的原则性视角来解决此问题,该方法保证在对抗性输入扰动下的性能。通过考虑在 Wasserstein 球中扰动底层数据分布的拉格朗日罚函数表述,我们提供了一种训练过程,用训练数据的最坏情况扰动来增强模型参数更新。对于光滑损失,我们的过程可证明地以相对于经验风险最小化极小的计算或统计代价实现中等水平的鲁棒性。此外,我们的统计保证使我们能够高效地证明总体损失的鲁棒性。对于不可感知的扰动,我们的方法匹配或优于启发式方法。
引用
@article{arxiv.1710.10571,
title = {Certifying Some Distributional Robustness with Principled Adversarial Training},
author = {Aman Sinha and Hongseok Namkoong and Riccardo Volpi and John Duchi},
journal= {arXiv preprint arXiv:1710.10571},
year = {2020}
}
备注
ICLR 2018: https://openreview.net/forum?id=Hk6kPgZA-