中文

GF-评分:具有公平性保证的认证类条件鲁棒性评估

机器学习 2026-04-15 v1 人工智能

摘要

对抗鲁棒性是神经网络在安全关键应用中必不可少的特性,但标准评估方法要么需要昂贵的对抗攻击,要么仅报告单一的聚合分数,掩盖了鲁棒性在类别间的分布情况。我们提出了 \emph{GF-评分}(GREAT-Fairness Score,GREAT-公平性评分),一个将认证 GREAT 评分分解为类别级鲁棒性轮廓并通过四个基于福利经济学指标量化其不平等性的框架:鲁棒性不平等指数(RDI)、归一化鲁棒性基尼系数(NRGC)、最差情况类别鲁棒性(WCR)以及公平性惩罚性 GREAT 评分(FP-GREAT)。该框架进一步通过仅使用干净准确率相关性进行自校准程序来消除原始方法对对抗攻击的依赖,方法是通过调整温度参数来实现。我们在 CIFAR-10 和 ImageNet 上评估了来自 RobustBench 的 22 个模型,发现分解是精确的,类别分数揭示了一致的脆弱模式(例如,“猫”在 76% 的 CIFAR-10 模型中是最弱类别),并且更鲁棒的模型倾向于表现出更大的类别层次不平等。这些结果建立了一个实用的、无攻击的审计管线,用于诊断认证鲁棒性保证在各类别间的失效情况。我们在 GitHub 上发布了代码。

关键词

引用

@article{arxiv.2604.12757,
  title  = {GF-Score: Certified Class-Conditional Robustness Evaluation with Fairness Guarantees},
  author = {Arya Shah and Kaveri Visavadiya and Manisha Padala},
  journal= {arXiv preprint arXiv:2604.12757},
  year   = {2026}
}

备注

16 pages, 5 tables, 9 figures