中文

强度自适应对抗训练

机器学习 2022-10-05 v1 密码学与安全

摘要

对抗训练(AT)被证明能可靠地提升网络对对抗数据的鲁棒性。然而,当前具有预指定扰动预算的 AT 在学习鲁棒网络方面存在局限。首先,在各种模型容量的网络上施加预指定扰动预算,将导致自然准确率与鲁棒准确率之间出现不同程度的鲁棒性差异,这偏离了鲁棒网络的期望。其次,受预指定扰动预算约束的对抗训练数据的攻击强度,无法随网络鲁棒性的增长而提升,从而导致鲁棒过拟合并进一步降低对抗鲁棒性。为克服这些局限,我们提出强度自适应对抗训练(Strength-Adaptive Adversarial Training, SAAT)。具体而言,对手采用对抗损失约束来生成对抗训练数据。在此约束下,扰动预算将根据对抗数据的训练状态自适应调整,从而有效避免鲁棒过拟合。此外,SAAT 通过对抗损失显式约束训练数据的攻击强度,从而在训练过程中调控模型容量调度,进而可灵活控制鲁棒性差异的程度并调整自然准确率与鲁棒性之间的权衡。大量实验表明,我们的方案提升了对抗训练的鲁棒性。

关键词

引用

@article{arxiv.2210.01288,
  title  = {Strength-Adaptive Adversarial Training},
  author = {Chaojian Yu and Dawei Zhou and Li Shen and Jun Yu and Bo Han and Mingming Gong and Nannan Wang and Tongliang Liu},
  journal= {arXiv preprint arXiv:2210.01288},
  year   = {2022}
}