持续学习中的持久后门攻击
机器学习
2025-07-30 v3 密码学与安全
摘要
后门攻击对神经网络构成重大威胁,使攻击者能够在特定输入上操纵模型输出,这在关键应用中往往会产生灾难性后果。尽管后门攻击已在各种背景下被研究,但很少有人关注它们在持续学习中的实用性和持久性,特别是了解随着新数据分布被学习并整合,模型参数的持续更新如何影响这些攻击随时间的有效性。为了填补这一空白,我们引入了两种持久后门攻击——盲任务后门和潜在任务后门——每种攻击都利用了最小的对抗性影响。我们的盲任务后门在不直接控制训练过程的情况下巧妙地改变了损失计算,而潜在任务后门仅影响单个任务的训练,所有其他任务均正常训练。我们在各种配置下评估了这些攻击,展示了它们在静态、动态、物理和语义触发器下的有效性。我们的结果表明,这两种攻击在不同的持续学习算法中均能持续实现高成功率,同时能有效规避 SentiNet 和 I-BAU 等最先进的防御手段。
引用
@article{arxiv.2409.13864,
title = {Persistent Backdoor Attacks in Continual Learning},
author = {Zhen Guo and Abhinav Kumar and Reza Tourani},
journal= {arXiv preprint arXiv:2409.13864},
year = {2025}
}
备注
19 pages, 20 figures, 6 tables