中文

针对未知攻击的鲁棒性形式化建模

机器学习 2022-10-03 v3

摘要

现有的对抗样本防御方法(如对抗训练)通常假设对手会符合特定或已知的威胁模型,例如固定预算内的 p\ell_p 扰动。在本文中,我们关注这样一种场景:防御方在训练时假设的威胁模型与测试时对手的实际能力之间存在不匹配。我们提出以下问题:如果学习器针对特定的“源”威胁模型进行训练,何时可以期望鲁棒性在测试时泛化到更强的未知“目标”威胁模型?我们的关键贡献是形式化定义了在未知对手下进行学习与泛化的问题,这有助于我们从已知对手的传统视角出发,推理对抗风险的增加。应用我们的框架,我们推导了一个泛化界,该界将源威胁模型与目标威胁模型之间的泛化差距与特征提取器的变异性相关联,后者衡量在给定威胁模型下提取特征之间的期望最大差异。基于我们的泛化界,我们提出了变分正则化(VR),在训练过程中降低特征提取器在源威胁模型上的变异性。我们通过实验证明,使用 VR 可以在测试时改善对未知攻击的泛化,并且将 VR 与感知对抗训练(Laidlaw et al., 2021)结合可在未知攻击上实现最先进的鲁棒性。我们的代码公开于 https://github.com/inspire-group/variation-regularization。

关键词

引用

@article{arxiv.2204.13779,
  title  = {Formulating Robustness Against Unforeseen Attacks},
  author = {Sihui Dai and Saeed Mahloujifar and Prateek Mittal},
  journal= {arXiv preprint arXiv:2204.13779},
  year   = {2022}
}

备注

NeurIPS 2022