中文

论后门在演化模型中的持久性

密码学与安全 2023-02-10 v2 计算机视觉与模式识别 机器学习

摘要

现有关于深度神经网络(DNN)训练时攻击(如后门)的研究,很大程度上假设模型一旦训练完成便是静态的,并且植入模型的隐藏后门会无限期保持活跃。在实践中,模型很少是静态的,而是持续演化以应对底层数据中的分布漂移。本文探讨了后门攻击在时变模型中的行为,其时变模型权重通过微调持续更新以适应数据漂移。我们的理论分析展示了使用新数据微调如何逐步“擦除”注入的后门,并且我们的实证研究说明了时变模型在各种训练和攻击设置下多快“遗忘”后门。我们还展示了使用智能学习率的新型微调策略可显著加速后门遗忘。最后,我们讨论了对专门针对时变模型的新型后门防御的需求。

关键词

引用

@article{arxiv.2206.04677,
  title  = {On the Permanence of Backdoors in Evolving Models},
  author = {Huiying Li and Arjun Nitin Bhagoji and Yuxin Chen and Haitao Zheng and Ben Y. Zhao},
  journal= {arXiv preprint arXiv:2206.04677},
  year   = {2023}
}