中文

利用扩散模型提升认证对抗鲁棒性的水准

机器学习 2023-05-18 v1 密码学与安全 计算机视觉与模式识别

摘要

针对对抗攻击的认证防御提供模型鲁棒性的形式化保证,使其比经验性方法(如对抗训练)更可靠,后者效果常随后被未见攻击削弱。然而,当前可实现的有限认证鲁棒性一直是其实际应用的瓶颈。Gowal 等人与 Wang 等人已表明,使用最先进的扩散模型生成额外训练数据可显著提升对抗训练的鲁棒性。在本工作中,我们证明类似方法可大幅改进确定性认证防御。此外,我们提供了一系列建议以扩展认证训练方法的鲁棒性。我们的主要见解之一是:泛化差距(即原模型训练与测试精度之差)是使用额外生成数据时鲁棒性提升幅度的良好预测指标。我们的方法在 CIFAR-10 上针对 2\ell_2ϵ=36/255\epsilon = 36/255)与 \ell_\inftyϵ=8/255\epsilon = 8/255)威胁模型取得了最先进的确定性鲁棒性认证,分别将此前最佳结果提升了 +3.95%+3.95\%+1.39%+1.39\%。此外,我们在 CIFAR-100 上报告了类似改进。

关键词

引用

@article{arxiv.2305.10388,
  title  = {Raising the Bar for Certified Adversarial Robustness with Diffusion Models},
  author = {Thomas Altstidl and David Dobre and Björn Eskofier and Gauthier Gidel and Leo Schwinn},
  journal= {arXiv preprint arXiv:2305.10388},
  year   = {2023}
}