自集成对抗训练以增强鲁棒性
机器学习
2022-05-04 v2 密码学与安全
摘要
由于机器智能在现实应用中的诸多突破,深度神经网络(DNNs)被广泛用于关键应用中。然而,DNNs 的预测很容易被难以察觉的对抗扰动所操纵,这阻碍了 DNNs 的进一步部署,并可能导致深远的安全与隐私影响。通过将对抗样本纳入训练数据池,对抗训练是所有防御方法中针对各类对抗攻击最强有原则的策略。近期工作主要聚焦于开发新的损失函数或正则化器,试图在权重空间中找到唯一的最优点。但它们都未挖掘标准对抗训练所得分类器的潜力,尤其是训练搜索轨迹上的状态。本工作中,我们致力于模型在训练过程中的权重状态,并设计了一种简单但强大的自集成对抗训练(Self-Ensemble Adversarial Training, SEAT)方法,通过对历史模型权重取平均来产生鲁棒分类器。这显著提升了目标模型针对若干知名对抗攻击的鲁棒性,即便仅使用朴素的交叉熵损失进行监督。我们还讨论了不同对抗训练模型的预测集成与权重集成模型预测之间的关系,并提供理论与经验证据,表明所提自集成方法比单个模型及不同分类器预测集成具有更平滑的损失景观与更好的鲁棒性。我们进一步分析了自集成模型通用设置中一个微妙但致命的问题,它导致权重集成方法在后期阶段的退化。
引用
@article{arxiv.2203.09678,
title = {Self-Ensemble Adversarial Training for Improved Robustness},
author = {Hongjun Wang and Yisen Wang},
journal= {arXiv preprint arXiv:2203.09678},
year = {2022}
}
备注
18 pages, 3 figures, ICLR 2022