中文

深度学习模型的行为后门

机器学习 2024-12-03 v1 人工智能

摘要

深度学习模型的各种后处理方法,如量化、剪枝和微调,在人工智能技术中发挥着越来越重要的作用,其中预训练大模型是主要的开发方向之一。然而,这一流行的后处理系列方法针对预训练深度模型,已成为新的对抗安全问题的温床。在本研究中,我们首次提出“行为后门”攻击,定义为一种行为触发的后门模型训练程序,以揭示后门攻击的新范式。实际中,我们利用模型量化方法作为触发器,提出了量化后门(QB)攻击的第一个实现管道。具体而言,为适应行为后门的优化目标,我们引入一种基于双目标行为后门训练损失的方法,以实现行为驱动的后门目标优化,从而引导受毒化模型的优化方向。为跨多个模型更新参数,我们采用地址共享后门模型训练方式,从而能够利用梯度信息进行多模型协作优化。我们在不同的模型、数据集和任务上进行了大量实验,表明该新型后门攻击的有效性以及其潜在的应用威胁。

关键词

引用

@article{arxiv.2412.01369,
  title  = {Behavior Backdoor for Deep Learning Models},
  author = {Jiakai Wang and Pengfei Zhang and Renshuai Tao and Jian Yang and Hao Liu and Xianglong Liu and Yunchao Wei and Yao Zhao},
  journal= {arXiv preprint arXiv:2412.01369},
  year   = {2024}
}