论后门在演化模型中的持久性
密码学与安全
2023-02-10 v2 计算机视觉与模式识别
机器学习
摘要
现有关于深度神经网络(DNN)训练时攻击(如后门)的研究,很大程度上假设模型一旦训练完成便是静态的,并且植入模型的隐藏后门会无限期保持活跃。在实践中,模型很少是静态的,而是持续演化以应对底层数据中的分布漂移。本文探讨了后门攻击在时变模型中的行为,其时变模型权重通过微调持续更新以适应数据漂移。我们的理论分析展示了使用新数据微调如何逐步“擦除”注入的后门,并且我们的实证研究说明了时变模型在各种训练和攻击设置下多快“遗忘”后门。我们还展示了使用智能学习率的新型微调策略可显著加速后门遗忘。最后,我们讨论了对专门针对时变模型的新型后门防御的需求。
引用
@article{arxiv.2206.04677,
title = {On the Permanence of Backdoors in Evolving Models},
author = {Huiying Li and Arjun Nitin Bhagoji and Yuxin Chen and Haitao Zheng and Ben Y. Zhao},
journal= {arXiv preprint arXiv:2206.04677},
year = {2023}
}