对抗训练能否被非鲁棒特征操纵?
机器学习
2022-10-11 v4 密码学与安全
摘要
对抗训练最初旨在抵御测试时的对抗样本,现已展现出在缓解训练时可用性攻击方面的潜力。然而,本文对这种防御能力提出了挑战。我们识别出一种名为稳定性攻击的新型威胁模型,其旨在通过轻微操纵训练数据来阻碍鲁棒可用性。在此威胁下,我们表明,在一个简单的统计环境中,使用常规防御预算 的对抗训练可证明无法提供测试鲁棒性,其中训练数据的非鲁棒特征可以通过 有界扰动得到增强。此外,我们分析了扩大防御预算以对抗稳定性攻击的必要性。最后,综合实验表明稳定性攻击在基准数据集上是有害的,因此自适应防御对于维持鲁棒性是必要的。我们的代码可在 https://github.com/TLMichael/Hypocritical-Perturbation 获取。
引用
@article{arxiv.2201.13329,
title = {Can Adversarial Training Be Manipulated By Non-Robust Features?},
author = {Lue Tao and Lei Feng and Hongxin Wei and Jinfeng Yi and Sheng-Jun Huang and Songcan Chen},
journal= {arXiv preprint arXiv:2201.13329},
year = {2022}
}
备注
NeurIPS 2022