中文

面向类别公平性的对抗训练:基于反偏置软标签蒸馏

计算机视觉与模式识别 2025-06-11 v1

摘要

对抗训练(Adversarial Training, AT)广泛被认作提高深度神经网络对抗鲁棒性的有效方法。作为AT的一种变体,对抗鲁棒性蒸馏(Adversarial Robustness Distillation, ARD)在提升小模型鲁棒性方面表现突出。然而,AT和ARD都面临鲁棒公平性问题:这些模型对某些类别(容易类别)表现出强大的对抗鲁棒性,而对其他类别(困难类别)则表现出弱的对抗鲁棒性。本文探讨了该问题的根本因素,指出软标签在不同类别上的光滑程度对鲁棒公平性影响显著,既通过经验观察又通过理论分析进行了阐述。基于上述探索,我们在知识蒸馏框架内提出了反偏置软标签蒸馏(Anti-Bias Soft Label Distillation, ABSLD),以增强对抗鲁棒性公平性。具体而言,ABSLD通过在训练过程中调整教师软标签在不同类别上的光滑程度,从而自适应地降低学生模型在不同类别之间的误差风险差距,调整过程通过为不同类别分配不同的温度来实现。此外,作为一种基于标签的方法,ABSLD具有很高的可适应性,能够与基于样本的方法相集成。大量实验表明,ABSLD在鲁棒性和公平性的综合性能上超越了当前最先进的方法。

关键词

引用

@article{arxiv.2506.08611,
  title  = {Towards Class-wise Fair Adversarial Training via Anti-Bias Soft Label Distillation},
  author = {Shiji Zhao and Chi Chen and Ranjie Duan and Xizhe Wang and Xingxing Wei},
  journal= {arXiv preprint arXiv:2506.08611},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2312.05508