中文

正则化与生成式持续学习模型中的对抗性定向遗忘

机器学习 2021-02-17 v1 密码学与安全

摘要

当需要从后续批次或流数据中学习额外知识或任务时,会采用持续(或“增量”)学习方法。然而这些方法通常是对抗无关的,即它们未考虑恶意攻击的可能性。在我们之前的工作中,我们探索了弹性权重巩固(EWC)对可感知错误信息的脆弱性。我们现在探索其他基于正则化以及基于生成重放的持续学习算法的脆弱性,并将攻击扩展到不可感知的错误信息。我们展示了一个智能对手可以利用持续学习算法随时间保留现有知识的能力,并迫使其学习并保留故意引入的错误信息。为证明此脆弱性,我们将后门攻击样本注入训练数据中。这些攻击样本构成错误信息,使攻击者在测试时捕获对模型的控制。我们在旋转和分割基准变体的 MNIST 数据集上,在两种重要的域和类增量学习场景下评估此脆弱性的程度。我们展示对手可以通过向该任务的测试实例插入精心设计的后门样本,就任何任务创建“虚假记忆”,从而控制其选定任何任务的遗忘量。或许最重要的是,我们展示此脆弱性非常严重且具破坏性:即使错误信息对人眼不可感知,仅向少至 1\% 的训练数据中添加后门样本即可轻易破坏模型记忆。

关键词

引用

@article{arxiv.2102.08355,
  title  = {Adversarial Targeted Forgetting in Regularization and Generative Based Continual Learning Models},
  author = {Muhammad Umer and Robi Polikar},
  journal= {arXiv preprint arXiv:2102.08355},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2002.07111