通过抗偏置软标签蒸馏提升对抗鲁棒公平性
机器学习
2024-11-01 v3 计算机视觉与模式识别
计算机与社会
摘要
对抗训练(AT)已被广泛证明是提升深度神经网络(DNN)对抗对抗样本鲁棒性的有效方法。作为 AT 的一种变体,对抗鲁棒性蒸馏(ARD)在大模型指导下提升小模型鲁棒性方面展现出了卓越的性能。然而,AT 和 ARD 都面临鲁棒公平性问题:这些模型在面对部分类别(易处理类)时表现出强鲁棒性,而在面对其他类别(难处理类)时鲁棒性较弱。在本文中,我们深入分析了潜在因素,并从经验观察和理论分析两方面论证了不同类别(即难处理类或易处理类)样本软标签的平滑度将影响 DNN 的鲁棒公平性。基于上述发现,我们提出了一种抗偏置软标签蒸馏(ABSLD)方法,以在知识蒸馏(KD)框架内缓解对抗鲁棒公平性问题。具体而言,ABSLD 通过在训练过程中调整样本软标签的类别级平滑度,自适应地减小学生模型在不同类别间的误差风险差距以实现公平性,而软标签的平滑度则是通过在 KD 中为不同类别分配不同的温度来控制的。大量实验表明,在鲁棒性和公平性的综合度量指标(归一化标准差)上,ABSLD 优于最先进的 AT、ARD 和鲁棒公平性方法。
引用
@article{arxiv.2312.05508,
title = {Improving Adversarial Robust Fairness via Anti-Bias Soft Label Distillation},
author = {Shiji Zhao and Ranjie Duan and Xizhe Wang and Xingxing Wei},
journal= {arXiv preprint arXiv:2312.05508},
year = {2024}
}
备注
Accepted by NeurIPS2024