通过平衡对抗训练提升鲁棒公平性
机器学习
2022-09-19 v1 人工智能
密码学与安全
摘要
对抗训练(AT)方法能有效抵御对抗攻击,却在不同类别间引入准确率与鲁棒性的严重差异,即鲁棒公平性问题。先前提出的公平鲁棒学习(FRL)自适应地重新加权不同类别以改善公平性,但表现较好类别的性能下降,导致整体性能大幅跌落。本文中,我们观察到对抗训练期间的两种不公平现象:各类别生成对抗样本的难易程度不同(源类公平性),以及生成对抗样本时目标类倾向存在差异(目标类公平性)。基于上述观察,我们提出平衡对抗训练(BAT)以解决鲁棒公平性问题。针对源类公平性,我们调整各类的攻击强度与难度,以生成靠近决策边界的样本,从而实现更易且更公平的模式学习;考虑目标类公平性,通过引入均匀分布约束,我们鼓励各类别的对抗样本生成过程具有公平倾向。在多个数据集(CIFAR-10、CIFAR-100 与 ImageNette)上开展的广泛实验表明,我们的方法在缓解鲁棒公平性问题上显著优于其他基线(最差类别准确率提升 5–10%)。
引用
@article{arxiv.2209.07534,
title = {Improving Robust Fairness via Balance Adversarial Training},
author = {Chunyu Sun and Chenye Xu and Chengyuan Yao and Siyuan Liang and Yichao Wu and Ding Liang and XiangLong Liu and Aishan Liu},
journal= {arXiv preprint arXiv:2209.07534},
year = {2022}
}