置信度校准对抗训练:泛化至未见攻击
机器学习
2020-07-01 v4 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗训练针对特定威胁模型(例如 对抗样本)产生鲁棒模型。通常鲁棒性不能泛化到先前未见的威胁模型,例如其他 范数或更大的扰动。我们的置信度校准对抗训练(CCAT)通过将模型偏向于对对抗样本给出低置信度预测来解决此问题。通过允许拒绝低置信度样本,鲁棒性可泛化到训练中所用威胁模型之外。CCAT 仅以 对抗样本训练,却提升了对更大 、、 和 攻击、对抗帧、远端对抗样本及 corrupted 样本的鲁棒性,且相比对抗训练具有更好的干净准确率。为彻底评估,我们开发了直接通过最大化置信度攻击 CCAT 的新型白盒与黑盒攻击。对于每个威胁模型,我们使用多达 种攻击、 次重启与 次迭代,并报告所有攻击下的最坏情况鲁棒测试误差(扩展至我们的置信度阈值设定)。
引用
@article{arxiv.1910.06259,
title = {Confidence-Calibrated Adversarial Training: Generalizing to Unseen Attacks},
author = {David Stutz and Matthias Hein and Bernt Schiele},
journal= {arXiv preprint arXiv:1910.06259},
year = {2020}
}