面向对抗攻击下不确定性校准的认证
机器学习
2025-02-26 v3 机器学习
摘要
由于神经分类器对改变其准确性的对抗扰动敏感,已开发出认证方法以提供其预测对此类扰动不敏感的可证明保证。此外,在安全关键应用中,分类器置信度的频率解释(也称为模型校准)至关重要。该属性可通过Brier分数或期望校准误差来衡量。我们表明攻击会显著损害校准,因此提出认证校准作为对抗扰动下校准的最坏情况界限。具体地,我们为Brier分数生成解析界限,并通过求解混合整数规划对期望校准误差生成近似界限。最后,我们提出新颖的校准攻击,并展示如何通过对抗校准训练来改善模型校准。
引用
@article{arxiv.2405.13922,
title = {Towards Certification of Uncertainty Calibration under Adversarial Attacks},
author = {Cornelius Emde and Francesco Pinto and Thomas Lukasiewicz and Philip H. S. Torr and Adel Bibi},
journal= {arXiv preprint arXiv:2405.13922},
year = {2025}
}
备注
10 pages main paper, appendix included Published at: International Conference on Learning Representations (ICLR) 2025