中文

基于掩码自编码器的测试时对抗样本检测与修复

计算机视觉与模式识别 2023-04-04 v3 机器学习

摘要

训练时防御(即对抗训练)训练成本高昂,且无法泛化至未见过的攻击。测试时防御解决了这些问题,但大多数现有测试时防御需要调整模型权重,因此无法用于冻结模型,并使模型内存管理复杂化。唯一不调整模型权重的测试时防御旨在通过自监督任务来适配输入。然而,我们通过实验发现这些自监督任务对准确检测对抗攻击不够敏感。本文提出 DRAM,一种利用掩码自编码器(MAE)在测试时检测并修复对抗样本的新型防御方法。我们展示了如何使用 MAE 损失构建 Kolmogorov-Smirnov 检验来检测对抗样本。此外,我们利用 MAE 损失计算输入反转向量,以修复由先前未见过的攻击产生的对抗样本。在大规模 ImageNet 数据集上的结果表明,与所有评估的检测基线相比,DRAM 在评估的全部八种对抗攻击上取得了最佳检测率(平均 82%)。对于攻击修复,与使用对比学习和旋转预测的基线相比,DRAM 将标准 ResNet50 的鲁棒准确率提升了 6% ~ 41%,将鲁棒 ResNet50 提升了 3% ~ 8%。

关键词

引用

@article{arxiv.2303.12848,
  title  = {Test-time Detection and Repair of Adversarial Samples via Masked Autoencoder},
  author = {Yun-Yun Tsai and Ju-Chin Chao and Albert Wen and Zhaoyuan Yang and Chengzhi Mao and Tapan Shah and Junfeng Yang},
  journal= {arXiv preprint arXiv:2303.12848},
  year   = {2023}
}