两个耦合拒绝度量可区分对抗样本
机器学习
2022-04-01 v4 密码学与安全
计算机视觉与模式识别
摘要
正确分类对抗样本是安全部署机器学习模型的基本要求但具挑战性。如RobustBench所报道,即便是最先进的对抗训练模型在CIFAR-10上也难以超过67%的鲁棒测试精度,远未实用。通向鲁棒性的一种补充方法是引入拒绝选项,允许模型不对不确定输入返回预测,其中置信度是常用的确定性代理。沿此思路,我们发现置信度与一种修正置信度(R-Con)可形成两个耦合拒绝度量,可证明地将错误分类输入与正确分类输入区分开。这一引人注目的特性为使用耦合策略更好地检测和拒绝对抗样本提供了启示。我们在CIFAR-10、CIFAR-10-C和CIFAR-100上针对若干攻击(包括自适应攻击)评估了我们的修正拒绝(RR)模块,并证明RR模块兼容不同的对抗训练框架以提升鲁棒性,且额外计算开销很小。代码见https://github.com/P2333/Rectified-Rejection。
引用
@article{arxiv.2105.14785,
title = {Two Coupled Rejection Metrics Can Tell Adversarial Examples Apart},
author = {Tianyu Pang and Huishuai Zhang and Di He and Yinpeng Dong and Hang Su and Wei Chen and Jun Zhu and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2105.14785},
year = {2022}
}
备注
CVPR 2022