对抗训练对不确定性攻击的鲁棒性研究
机器学习
2025-05-28 v2
摘要
在学习问题中,任务固有的噪声使得在没有一定程度不确定性的情况下进行推断变得困难。量化这种不确定性,无论其用途多么广泛,对于安全敏感的应用都具有高度相关性。在这些场景中,保证良好(即可信)的不确定性度量变得至关重要,下游模块可以安全地利用这些度量来驱动最终的决策过程。然而,攻击者可能有意迫使系统产生(i)高度不确定的输出,从而危及系统的可用性,或(ii)低不确定性估计,使系统接受那些本需要仔细检查(例如,人工干预)的不确定样本。因此,理解如何获得针对这些攻击的鲁棒不确定性估计变得至关重要。在这项工作中,我们从经验和理论上揭示,防御对抗样本,即那些导致错误分类的精心扰动的样本,还能在常见的攻击场景下保证更安全、更可信的不确定性估计,而无需专门的防御策略。为了支持我们的观点,我们在 CIFAR-10 和 ImageNet 数据集上评估了来自公开基准 RobustBench 的多个对抗鲁棒模型。
引用
@article{arxiv.2410.21952,
title = {On the Robustness of Adversarial Training Against Uncertainty Attacks},
author = {Emanuele Ledda and Giovanni Scodeller and Daniele Angioni and Giorgio Piras and Antonio Emanuele Cinà and Giorgio Fumera and Battista Biggio and Fabio Roli},
journal= {arXiv preprint arXiv:2410.21952},
year = {2025}
}