中文

DLP:基于解耦学习过程的后门攻击主动防御策略

密码学与安全 2024-06-21 v1

摘要

深度学习模型已知会受到后门攻击的威胁,攻击者只需提供带有注入触发器的被篡改数据集,即可在训练数据上训练出植入后门的数据集。经训练的模型会被动地植入后门,在测试时,触发器输入可误导模型。我们的研究表明,在训练期间,模型对干净子集和被污染子集的学习行为存在差异。基于此观察,我们提出了一种通用的训练管道以积极防御后门攻击。通过将学习过程解耦为三个阶段(监督学习、主动遗忘和主动半监督微调),可在不可靠的数据集上训练出良性模型。我们在各种后门攻击和数据集上进行了大量实验,证明了该方法的有效性。

关键词

引用

@article{arxiv.2406.13098,
  title  = {DLP: towards active defense against backdoor attacks with decoupled learning process},
  author = {Zonghao Ying and Bin Wu},
  journal= {arXiv preprint arXiv:2406.13098},
  year   = {2024}
}