迈向公平的类别鲁棒性:类别最优分布对抗训练
机器学习
2025-01-09 v1 计算机视觉与模式识别
摘要
对抗训练已被证明是提升深度神经网络抵御对抗攻击鲁棒性的高效方法。然而,它在鲁棒公平性方面表现出局限性,表现为不同类别之间鲁棒性的显著差异。最近为缓解该问题所做的努力转向了类别加权方法。然而,这些方法缺乏严格的理论分析,并且由于主要依赖现有启发式算法或直觉来计算权重,对权重空间的探索有限。此外,由于权重与模型参数的解耦优化,这些方法无法保证优化方向的一致性。它们可能导致次优的权重分配,从而产生次优的模型。为解决这些问题,本文提出了一种新颖的极小极大训练框架——类别最优分布对抗训练(CODAT),它采用分布鲁棒优化来充分探索类别权重空间,从而能够在理论保证下识别最优权重。此外,我们推导了内部最大化的闭式最优解,进而得到一个确定性的等价目标函数,为权重与模型参数的联合优化提供了理论基础。同时,我们提出了一个公平弹性系数,用于从鲁棒性和鲁棒公平性两方面评估算法。在多个数据集上的实验结果表明,所提方法能够有效提升模型的鲁棒公平性,并优于最先进的方法。
引用
@article{arxiv.2501.04527,
title = {Towards Fair Class-wise Robustness: Class Optimal Distribution Adversarial Training},
author = {Hongxin Zhi and Hongtao Yu and Shaome Li and Xiuming Zhao and Yiteng Wu},
journal= {arXiv preprint arXiv:2501.04527},
year = {2025}
}