中文

通过对抗对数更新提升对抗鲁棒性

机器学习 2023-08-30 v1 密码学与安全

摘要

深度神经网络易受对抗扰动影响。对抗训练和对抗净化是公认最广泛的防御策略。尽管这些方法底层逻辑不同,但都依赖绝对对数值来生成标签预测。在本研究中,我们从理论角度分析了成功对抗攻击周围的对数差异,并提出了一种新原则,即对抗对数更新(Adversarial Logit Update, ALU),以推断对抗样本的标签。基于 ALU,我们引入了一种新的分类范式,利用净化前和净化后的对数差异来提升模型的对抗鲁棒性。无需对抗或额外数据用于模型训练,我们的干净数据合成模型可轻松应用于各种预训练模型,用于对抗样本检测和基于 ALU 的数据分类。在 CIFAR-10、CIFAR-100 和 tiny-ImageNet 数据集上的大量实验表明,即使使用简单组件,所提方案在针对广泛对抗攻击时也实现了优于 SOTA 方法的鲁棒性表现。我们的 Python 实现已提交于补充文档中,并将在论文被接收后发布。

关键词

引用

@article{arxiv.2308.15072,
  title  = {Advancing Adversarial Robustness Through Adversarial Logit Update},
  author = {Hao Xuan and Peican Zhu and Xingyu Li},
  journal= {arXiv preprint arXiv:2308.15072},
  year   = {2023}
}