中文

对抗训练能否被非鲁棒特征操纵?

机器学习 2022-10-11 v4 密码学与安全

摘要

对抗训练最初旨在抵御测试时的对抗样本,现已展现出在缓解训练时可用性攻击方面的潜力。然而,本文对这种防御能力提出了挑战。我们识别出一种名为稳定性攻击的新型威胁模型,其旨在通过轻微操纵训练数据来阻碍鲁棒可用性。在此威胁下,我们表明,在一个简单的统计环境中,使用常规防御预算 ϵ\epsilon 的对抗训练可证明无法提供测试鲁棒性,其中训练数据的非鲁棒特征可以通过 ϵ\epsilon 有界扰动得到增强。此外,我们分析了扩大防御预算以对抗稳定性攻击的必要性。最后,综合实验表明稳定性攻击在基准数据集上是有害的,因此自适应防御对于维持鲁棒性是必要的。我们的代码可在 https://github.com/TLMichael/Hypocritical-Perturbation 获取。

关键词

引用

@article{arxiv.2201.13329,
  title  = {Can Adversarial Training Be Manipulated By Non-Robust Features?},
  author = {Lue Tao and Lei Feng and Hongxin Wei and Jinfeng Yi and Sheng-Jun Huang and Songcan Chen},
  journal= {arXiv preprint arXiv:2201.13329},
  year   = {2022}
}

备注

NeurIPS 2022