通过多目标表征学习提升对抗鲁棒性
机器学习
2025-07-01 v4 计算机视觉与模式识别
摘要
深度神经网络(DNNs)对小型对抗扰动(即看似微不足道但导致模型产生截然不同输出的输入数据小变化)高度脆弱。许多防御方法需要在评估时修改模型架构或执行测试时的数据净化。这不仅引入了额外的复杂性,而且往往取决于模型架构。我们展示的是,在训练期间进行稳健特征学习可以显著提升 DNN 的鲁棒性。我们提出了 MOREL,一种多目标方法,通过余弦相似度和多正例对比损失来对齐自然特征和对抗特征,以鼓励相同类别输入具有相似特征。广泛的实验表明,MOREL 在对抗鲁棒性方面显著优于白盒和黑盒攻击。我们的代码已在 https://github.com/salomonhotegni/MOREL 上公开 availble。
引用
@article{arxiv.2410.01697,
title = {Enhancing Adversarial Robustness through Multi-Objective Representation Learning},
author = {Sedjro Salomon Hotegni and Sebastian Peitz},
journal= {arXiv preprint arXiv:2410.01697},
year = {2025}
}