中文

FAIR-TAT:通过定向对抗训练提升模型公平性

机器学习 2025-06-17 v3 计算机视觉与模式识别

摘要

深度神经网络容易受到对抗攻击和常见扰动的影响,从而损害其鲁棒性。为增强模型应对此类挑战的韧性,对抗训练(AT)已成为一种突出的解决方案。然而,对抗鲁棒性往往以牺牲模型公平性为代价获得,即模型在不同类别间的鲁棒性存在差异。虽然特征明显的类别对这类对抗样本变得更加鲁棒,但难以检测的类别则受损。近期研究专注于提升扰动图像上的模型公平性,而忽略了最可能的未扰动数据的准确性。此外,尽管最先进的经过对抗训练的模型对训练过程中遇到的对抗样本具有鲁棒性,但当面对多样化的对抗威胁或常见扰动时,难以维持鲁棒性和公平性。在本工作中,我们通过引入一种名为公平定向对抗训练(FAIR-TAT)的新方法来解决上述问题。我们证明,使用定向对抗攻击进行对抗训练(而非非定向攻击)可以在对抗公平性方面实现更有利的权衡。实验结果验证了我们方法的有效性。

关键词

引用

@article{arxiv.2410.23142,
  title  = {FAIR-TAT: Improving Model Fairness Using Targeted Adversarial Training},
  author = {Tejaswini Medi and Steffen Jung and Margret Keuper},
  journal= {arXiv preprint arXiv:2410.23142},
  year   = {2025}
}