中文

可持续自演化对抗训练

计算机视觉与模式识别 2025-10-09 v2 人工智能

摘要

随着深度神经网络模型在计算机视觉任务中广泛应用,针对深入探索模型安全,针对性地生成对抗样本的策略层出不穷。然而,依赖单一或有限类型攻击、一次性学习过程的现有对抗训练防御模型难以适应攻击方法动态演化的本质。为此,本文提出一种 novel 的可持续自演化对抗训练 (SSEAT) 框架。具体而言,引入持续对抗防御管道,实现跨多个阶段从各种类型的对抗样本中学习。此外,为解决持续学习中因持续获取新型攻击导致的模型灾难性遗忘问题,提出对抗数据回放模块,以更好地选择更具多样性和关键性的再学习数据。进一步,我们设计一致性正则化策略,鼓励当前防御模型从之前训练的模型中学习,引导其保留更多过往知识,同时保持对干净样本的准确性。广泛的实验表明,所提出的 SSEAT 防御方法在防御性能和分类准确率方面均优于竞争方法。代码已公开于 https://github.com/aup520/SSEAT。

关键词

引用

@article{arxiv.2412.02270,
  title  = {Sustainable Self-evolution Adversarial Training},
  author = {Wenxuan Wang and Chenglei Wang and Huihui Qi and Menghao Ye and Xuelin Qian and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2412.02270},
  year   = {2025}
}

备注

Accepted to ACMMM 2024