中文

涟漪效应:论后门攻击的意外并发症

密码学与安全 2025-05-20 v1 人工智能

摘要

近期研究凸显了对第三方预训练语言模型(PTLM)可信度的担忧,原因是潜在的后门攻击。然而,这些被植入后门的PTLM仅对特定的预定义下游任务有效。实际上,这些PTLM可以适配到许多其他不相关的下游任务。这种适配可能导致下游模型输出出现意外后果,从而引起用户怀疑并损害攻击的隐蔽性。我们将这种现象称为后门并发症。在本文中,我们首次对后门并发症进行了全面量化。通过使用4个主流PTLM和16个文本分类基准数据集进行广泛实验,我们证明了在由被植入后门的PTLM微调得到的下游模型中,后门并发症普遍存在。触发样本的输出分布与干净样本的输出分布显著偏离。因此,我们提出了一种利用多任务学习的后门并发症缓解方法,以在无需下游任务先验知识的情况下减轻并发症。实验结果表明,我们提出的方法能够有效减少并发症,同时保持后门攻击的有效性和一致性。我们的代码可在https://github.com/zhangrui4041/Backdoor_Complications获取。

关键词

引用

@article{arxiv.2505.11586,
  title  = {The Ripple Effect: On Unforeseen Complications of Backdoor Attacks},
  author = {Rui Zhang and Yun Shen and Hongwei Li and Wenbo Jiang and Hanxiao Chen and Yuan Zhang and Guowen Xu and Yang Zhang},
  journal= {arXiv preprint arXiv:2505.11586},
  year   = {2025}
}

备注

Accepted by ICML 2025