中文

对抗式遗忘:沿对抗方向降低置信度

机器学习 2022-06-06 v1 密码学与安全

摘要

以最大似然目标训练的监督学习方法常对训练数据过拟合。大多数防止过拟合的正则化器旨在增加对额外样本的置信度(如数据增强、对抗训练),或降低对训练数据的置信度(如标签平滑)。本工作中我们提出一种互补的正则化策略,降低对自生成样本的置信度。该方法称为 RCAD(Reducing Confidence along Adversarial Directions,沿对抗方向降低置信度),旨在降低位于为增加训练损失而对抗选择的方向上的分布外样本的置信度。与对抗训练不同,RCAD 不试图使模型对输出原始标签具有鲁棒性,而是正则化模型以对使用比常规对抗训练更大扰动生成的点的置信度降低。RCAD 可用几行代码轻松集成到训练流程中。尽管简单,我们在许多分类基准上发现 RCAD 可添加到现有技术(如标签平滑、MixUp 训练)上,将测试准确率绝对提升 1-3%,在低数据情形下增益更显著。我们还提供了理论分析,在简化设定下帮助解释这些益处,表明 RCAD 可证明有助于模型遗忘训练数据中的伪特征。

关键词

引用

@article{arxiv.2206.01367,
  title  = {Adversarial Unlearning: Reducing Confidence Along Adversarial Directions},
  author = {Amrith Setlur and Benjamin Eysenbach and Virginia Smith and Sergey Levine},
  journal= {arXiv preprint arXiv:2206.01367},
  year   = {2022}
}