中文

去噪平滑:一种面向预训练分类器的可证明防御

机器学习 2020-09-22 v2 密码学与安全 计算机视觉与模式识别 机器学习

摘要

我们提出一种可证明地防御任意预训练图像分类器免受 p\ell_p 对抗攻击的方法。例如,该方法允许公共视觉 API 提供方与用户将预训练的非鲁棒分类服务无缝转换为可证明鲁棒的服务。通过在任意现成图像分类器前附加一个定制训练的去噪器并使用随机平滑,我们有效创建了一个保证对对抗样本具有 p\ell_p 鲁棒性的新分类器,且无需修改预训练分类器。我们的方法适用于预训练分类器的白盒与黑盒设定。我们将此防御称为去噪平滑(denoised smoothing),并通过在 ImageNet 与 CIFAR-10 上的大量实验证明其有效性。最后,我们使用我们的方法对 Azure、Google、AWS 与 ClarifAI 的图像分类 API 进行可证明防御。复现本文所有实验的代码见:https://github.com/microsoft/denoised-smoothing。

关键词

引用

@article{arxiv.2003.01908,
  title  = {Denoised Smoothing: A Provable Defense for Pretrained Classifiers},
  author = {Hadi Salman and Mingjie Sun and Greg Yang and Ashish Kapoor and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2003.01908},
  year   = {2020}
}

备注

10 pages main text; 29 pages total