持续学习器中的针对性遗忘与虚假记忆形成:通过对抗后门攻击实现
机器学习
2020-02-19 v1 人工智能
密码学与安全
摘要
人工神经网络在从任务序列中持续学习时,众所周知易受灾难性遗忘的影响。人们已提出各种持续(或“增量”)学习方法以避免灾难性遗忘,但它们通常是对抗无关的,即未考虑恶意攻击的可能性。在这项工作中,我们探究了弹性权重巩固(EWC)——一种流行的避免灾难性遗忘的持续学习算法——的脆弱性。我们表明,智能对手可绕过 EWC 的防御,转而通过在训练期间向模型引入少量错误信息来造成渐进且蓄意的遗忘。我们在 MNIST 数据集的置换与切分基准变体上,通过对模型注入“后门”攻击样本,展示了此类对手接管模型控制权的能力。重要的是,一旦模型学习了对抗性错误信息,对手便可随后控制任意任务的遗忘量。等价地,恶意行为者可通过向该任务的任意比例测试实例插入精心设计的后门样本,来创建关于任意任务的“虚假记忆”。或许最具破坏性的是,我们表明该脆弱性极为严重;即便仅将后门样本加入单个任务训练数据的低至 1%,神经网络记忆也易被攻陷。
引用
@article{arxiv.2002.07111,
title = {Targeted Forgetting and False Memory Formation in Continual Learners through Adversarial Backdoor Attacks},
author = {Muhammad Umer and Glenn Dawson and Robi Polikar},
journal= {arXiv preprint arXiv:2002.07111},
year = {2020}
}