中文

退火自蒸馏校正改进对抗训练

机器学习 2024-04-16 v2 人工智能

摘要

在标准对抗训练中,模型被优化以在允许的对抗扰动预算内拟合独热标签。然而,对扰动所带来的潜在分布偏移的忽视导致了鲁棒过拟合问题。为解决该问题并增强对抗鲁棒性,我们分析了鲁棒模型的特征,发现鲁棒模型倾向于产生更平滑且校准良好的输出。基于该观察,我们提出了一种简单而有效的方法——退火自蒸馏校正(ADR),其生成软标签作为一种更好的引导机制,能准确反映对抗训练过程中受攻击下的分布偏移。利用 ADR,我们可以获得校正后的分布,在无需预训练模型或大量额外计算的情况下显著提升模型鲁棒性。此外,我们的方法通过替换其他对抗训练技术目标中的硬标签,可实现与其无缝即插即用的集成。我们通过大量实验和跨数据集的强劲表现证明了 ADR 的有效性。

关键词

引用

@article{arxiv.2305.12118,
  title  = {Annealing Self-Distillation Rectification Improves Adversarial Training},
  author = {Yu-Yu Wu and Hung-Jui Wang and Shang-Tse Chen},
  journal= {arXiv preprint arXiv:2305.12118},
  year   = {2024}
}

备注

Accepted to ICLR 2024