中文

基于标准差启发的正则化以提高对抗鲁棒性

机器学习 2024-12-31 v1 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

对抗训练(AT)已被证明可提高深度神经网络(DNN)对对抗性攻击的鲁棒性。AT 是一种 min-max 优化过程,其中生成对抗性样本以训练更具鲁棒性的 DNN。AT 的内层最大化步骤增加了输入相对于其实际类别的损失。外层最小化涉及对从内层最大化中获得的对抗性样本上的损失进行最小化。本工作提出一种基于标准差启发的(SDI)正则化项,以提高对抗鲁棒性和泛化能力。我们认为,AT 的内层最大化类似于最小化模型输出概率的修改后标准差。此外,我们建议,最大化此修改后标准差可补充 AT 框架的外层最小化。为支持我们的论点,我们实验表明,SDI 测度可用于制作对抗性样本。此外,我们展示了将 SDI 正则化项与现有 AT 变体结合使用,可提高 DNN 针对更强攻击(如 CW 和 Auto-attack)的鲁棒性,并改进泛化。

关键词

引用

@article{arxiv.2412.19947,
  title  = {Standard-Deviation-Inspired Regularization for Improving Adversarial Robustness},
  author = {Olukorede Fakorede and Modeste Atsague and Jin Tian},
  journal= {arXiv preprint arXiv:2412.19947},
  year   = {2024}
}