加固守护者而非宝藏:弹性对抗检测器
计算机视觉与模式识别
2024-07-02 v2 人工智能
摘要
本文提出RADAR——通过对抗重训练实现鲁棒对抗检测,这是一种旨在增强对抗检测器对自适应攻击的鲁棒性同时保持分类器性能的方法。自适应攻击是指攻击者知晓防御并相应调整其策略的攻击。我们提出的方法利用对抗训练来强化检测攻击的能力,同时不损害干净准确率。在训练阶段,我们将对抗样本集成到数据集中,这些样本经过优化以同时欺骗分类器和对抗检测器,从而使对抗检测器能够学习和适应潜在的攻击场景。在CIFAR-10和SVHN数据集上的实验评估表明,我们提出的算法显著提高了检测器准确识别自适应对抗攻击的能力,同时不牺牲干净准确率。
引用
@article{arxiv.2404.12120,
title = {Fortify the Guardian, Not the Treasure: Resilient Adversarial Detectors},
author = {Raz Lapid and Almog Dubin and Moshe Sipper},
journal= {arXiv preprint arXiv:2404.12120},
year = {2024}
}