刻画测试时攻击者下多类分类的最优 0-1 损失
机器学习
2023-12-08 v2 密码学与安全
摘要
寻找对对抗样本鲁棒的分类器对其安全部署至关重要。因此,在给定威胁模型和数据分布下确定最佳可能分类器的鲁棒性,并将其与最先进训练方法所达到的鲁棒性进行比较,是一种重要的诊断工具。在本文中,我们针对任意离散数据集上的多类分类器,给出了在测试时攻击者存在情况下可实现的信息论损失下界。我们提供了一个寻找最优 0-1 损失的通用框架,该框架围绕从数据和对抗约束构建冲突超图展开。我们进一步定义了攻击者-分类器博弈的其他变体,这些变体能比完整的超图构建更高效地确定最优损失的范围。我们的评估首次展示了在基准数据集上多类设定下分类器与最优鲁棒性差距的分析。
引用
@article{arxiv.2302.10722,
title = {Characterizing the Optimal 0-1 Loss for Multi-class Classification with a Test-time Attacker},
author = {Sihui Dai and Wenxin Ding and Arjun Nitin Bhagoji and Daniel Cullina and Ben Y. Zhao and Haitao Zheng and Prateek Mittal},
journal= {arXiv preprint arXiv:2302.10722},
year = {2023}
}
备注
NeurIPS 2023 Spotlight