中文

通过多目标表征学习提升对抗鲁棒性

机器学习 2025-07-01 v4 计算机视觉与模式识别

摘要

深度神经网络(DNNs)对小型对抗扰动(即看似微不足道但导致模型产生截然不同输出的输入数据小变化)高度脆弱。许多防御方法需要在评估时修改模型架构或执行测试时的数据净化。这不仅引入了额外的复杂性,而且往往取决于模型架构。我们展示的是,在训练期间进行稳健特征学习可以显著提升 DNN 的鲁棒性。我们提出了 MOREL,一种多目标方法,通过余弦相似度和多正例对比损失来对齐自然特征和对抗特征,以鼓励相同类别输入具有相似特征。广泛的实验表明,MOREL 在对抗鲁棒性方面显著优于白盒和黑盒攻击。我们的代码已在 https://github.com/salomonhotegni/MOREL 上公开 availble。

关键词

引用

@article{arxiv.2410.01697,
  title  = {Enhancing Adversarial Robustness through Multi-Objective Representation Learning},
  author = {Sedjro Salomon Hotegni and Sebastian Peitz},
  journal= {arXiv preprint arXiv:2410.01697},
  year   = {2025}
}