中文

面向对抗鲁棒性的一致性正则化

机器学习 2021-12-23 v3 人工智能

摘要

对抗训练(AT)目前是获得深度神经网络对抗鲁棒性最成功的方法之一。然而,鲁棒过拟合现象,即鲁棒性在 AT 期间开始显著下降,一直是个问题,不仅使实践者考虑一揽子技巧以成功训练(例如早停),还导致鲁棒性上的显著泛化差距。本文中,我们提出一种有效的正则化技术,通过在 AT 期间优化一个辅助的“一致性”正则化损失来防止鲁棒过拟合。具体而言,我们发现数据增强是缓解 AT 中过拟合的相当有效的工具,并发展了一种正则化,迫使同一实例两种不同增强后经攻击的预测分布彼此相似。我们的实验结果表明,这种简单的正则化技术为广泛的 AT 方法的测试鲁棒精度带来了显著提升。更值得注意的是,我们也展示我们的方法能显著帮助模型泛化其针对未见对抗样本的鲁棒性,例如相较于训练中所用类型或更大扰动的对抗样本。代码见 https://github.com/alinlab/consistency-adversarial。

关键词

引用

@article{arxiv.2103.04623,
  title  = {Consistency Regularization for Adversarial Robustness},
  author = {Jihoon Tack and Sihyun Yu and Jongheon Jeong and Minseon Kim and Sung Ju Hwang and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2103.04623},
  year   = {2021}
}

备注

Published as a conference proceeding for AAAI 2022