中文

TRIX:通过混合对抗训练实现对抗性公平性

机器学习 2025-07-11 v1 计算机视觉与模式识别

摘要

对抗训练(AT)是抗击对抗样本的广泛采用的防御方法,但现有方法通常在所有类别上应用统一训练目标,忽略类别间脆弱性差异。这导致对抗不公平:特征可区分性强的类别(强类别)趋向更健壮,而特征重叠或共享的类别(弱类别)则不堪一击。我们观察到强类别在训练中不需要强对抗样本,因其非鲁棒特征迅速被抑制;而弱类别受益于更强的对抗样本,以有效降低脆弱性。为此,我们引入TRIX,一种基于特征的对抗训练框架,为强类别分配较弱的有针对性对抗样本以促进特征多样性(通过均匀抽样目标),为弱类别分配更强的无目标对抗样本以提升其针对性鲁棒性。TRIX进一步整合了类别相关损失权重和扰动强度调整,在此基础上强化对弱类别的优化。在标准图像分类基准测试上进行全面实验,包括针对PGD和AutoAttack等强对抗攻击的评估,表明TRIX在干净数据和对抗数据上的最坏情况类别准确率显著提升,降低类别间鲁棒性差距,同时保持整体准确率。我们的结果表明,TRIX是实现公平且有效对抗防御的实用方法。

关键词

引用

@article{arxiv.2507.07768,
  title  = {TRIX- Trading Adversarial Fairness via Mixed Adversarial Training},
  author = {Tejaswini Medi and Steffen Jung and Margret Keuper},
  journal= {arXiv preprint arXiv:2507.07768},
  year   = {2025}
}