借鉴历史:一种基于代理引导与自蒸馏正则化的对抗防御框架
机器学习
2024-03-12 v2
摘要
对抗训练(Adversarial Training, AT)在增强深度学习模型鲁棒性方面至关重要,已被广泛应用于实际场景中。然而,现有的AT方法依赖于对目标模型防御进行直接迭代更新,常常遭遇训练不稳定和灾难性过拟合等障碍。在此背景下,我们的工作揭示了利用目标模型的历史状态作为代理以提供有效初始化和防御先验的潜力,由此提出了一个通用的代理引导防御框架「LAST」(Learn from the Past)。具体而言,LAST将代理模型的响应作为动态学习的快速权重,持续修正目标模型的更新方向。此外,我们引入了一种自蒸馏正则化防御目标,巧妙设计以在不借助外部教师模型的情况下引导代理模型的更新轨迹,从而缓解灾难性过拟合对性能的影响。大量实验与消融研究展示了该框架在显著提升模型鲁棒性(例如,在CIFAR10和CIFAR100数据集上鲁棒准确率分别提升高达9.2%和20.3%)和训练稳定性方面的有效性。这些改进在各种模型架构、更大数据集、扰动大小和攻击模态下均一致观察到,证实了LAST能够持续 refinement 单步与多步AT策略的能力。代码将发布于 https://github.com/callous-youth/LAST。
引用
@article{arxiv.2310.12713,
title = {Learn from the Past: A Proxy Guided Adversarial Defense Framework with Self Distillation Regularization},
author = {Yaohua Liu and Jiaxin Gao and Xianghao Jiao and Zhu Liu and Xin Fan and Risheng Liu},
journal= {arXiv preprint arXiv:2310.12713},
year = {2024}
}
备注
13 Pages