中文

LADDER:隐空间边界引导的对抗训练

机器学习 2022-07-07 v2

摘要

深度神经网络(DNNs)近来在许多分类任务中取得了巨大成功。遗憾的是,它们易受对抗攻击的影响,后者通过微小扰动生成对抗样本以欺骗 DNN 模型,尤其在模型共享场景中。对抗训练被证明是最有效的策略,其将对抗样本注入模型训练以提升 DNN 模型抵御对抗攻击的鲁棒性。然而,基于现有对抗样本的对抗训练未能很好地泛化到标准、未受扰动测试数据。为在标准准确率与对抗鲁棒性之间取得更好权衡,我们提出一种新颖的对抗训练框架,称为隐空间边界引导的对抗训练(LAtent bounDary-guided aDvErsarial tRaining, LADDER),该框架在隐空间边界引导的对抗样本上对 DNN 模型进行对抗训练。与大多数在输入空间中生成对抗样本的现有方法不同,LADDER 通过对隐特征添加扰动来生成大量高质量对抗样本。扰动沿由带注意力机制的 SVM 所构建的决策边界的法线方向进行。我们从边界场视角与可视化视角分析了所生成边界引导对抗样本的优势。在 MNIST、SVHN、CelebA 和 CIFAR-10 上的大量实验与详细分析验证了 LADDER 相较于原始 DNN 及竞争性基线在实现标准准确率与对抗鲁棒性更好权衡方面的有效性。

关键词

引用

@article{arxiv.2206.03717,
  title  = {LADDER: Latent Boundary-guided Adversarial Training},
  author = {Xiaowei Zhou and Ivor W. Tsang and Jie Yin},
  journal= {arXiv preprint arXiv:2206.03717},
  year   = {2022}
}

备注

To appear in Machine Learning