中文

置信度校准对抗训练:泛化至未见攻击

机器学习 2020-07-01 v4 密码学与安全 计算机视觉与模式识别 机器学习

摘要

对抗训练针对特定威胁模型(例如 LL_\infty 对抗样本)产生鲁棒模型。通常鲁棒性不能泛化到先前未见的威胁模型,例如其他 LpL_p 范数或更大的扰动。我们的置信度校准对抗训练(CCAT)通过将模型偏向于对对抗样本给出低置信度预测来解决此问题。通过允许拒绝低置信度样本,鲁棒性可泛化到训练中所用威胁模型之外。CCAT 仅以 LL_\infty 对抗样本训练,却提升了对更大 LL_\inftyL2L_2L1L_1L0L_0 攻击、对抗帧、远端对抗样本及 corrupted 样本的鲁棒性,且相比对抗训练具有更好的干净准确率。为彻底评估,我们开发了直接通过最大化置信度攻击 CCAT 的新型白盒与黑盒攻击。对于每个威胁模型,我们使用多达 77 种攻击、5050 次重启与 50005000 次迭代,并报告所有攻击下的最坏情况鲁棒测试误差(扩展至我们的置信度阈值设定)。

关键词

引用

@article{arxiv.1910.06259,
  title  = {Confidence-Calibrated Adversarial Training: Generalizing to Unseen Attacks},
  author = {David Stutz and Matthias Hein and Bernt Schiele},
  journal= {arXiv preprint arXiv:1910.06259},
  year   = {2020}
}