鲁棒特征推断:一种基于谱投影的测试时防御策略
机器学习
2024-08-26 v2 密码学与安全
摘要
测试时防御用于在推理过程中提升深度神经网络对对抗样本的鲁棒性。然而,现有方法要么需要额外的训练分类器来检测并纠正对抗样本,要么在测试时对模型参数或输入执行额外的复杂优化以适配对抗样本,导致相比基础模型的推理时间显著增加。本工作中,我们提出一种名为鲁棒特征推断(RFI)的新型测试时防御策略,其易于与任何现有(鲁棒)训练流程集成且无需额外测试时计算。基于我们所提出的特征鲁棒性概念,其核心思想是将训练好的模型投影到最鲁棒的特征空间,从而降低在非鲁棒方向上的对抗攻击脆弱性。我们从理论上刻画了广义加性模型中特征协方差特征谱中最鲁棒的子空间。我们在 CIFAR-10、CIFAR-100、tiny ImageNet 与 ImageNet 数据集上针对若干鲁棒性基准(包括 RobustBench 中的 SOTA 方法)的广泛实验表明,RFI 在自适应攻击与迁移攻击下一致地提升了鲁棒性。我们还将 RFI 与自适应测试时防御进行比较,以证明所提方法的有效性。
引用
@article{arxiv.2307.11672,
title = {Robust Feature Inference: A Test-time Defense Strategy using Spectral Projections},
author = {Anurag Singh and Mahalakshmi Sabanayagam and Krikamol Muandet and Debarghya Ghoshdastidar},
journal= {arXiv preprint arXiv:2307.11672},
year = {2024}
}
备注
Published in TMLR (28 pages, 6 figures, 20 tables)