中文

防御针对参数高效微调的权重投毒后门攻击

密码学与安全 2024-04-01 v3 人工智能 计算与语言

摘要

近期,各种应用于语言模型的参数高效微调 (PEFT) 策略已被提出并成功实施。然而,这引发了一个问题:仅更新有限模型参数集的 PEFT 在面对权重投毒后门攻击时是否构成安全漏洞。在本研究中,我们表明与全参数微调方法相比,PEFT 更容易受到权重投毒后门攻击的影响,预定义的触发器仍然可利用,且预定义的目标即使在微调后仍保持高置信度。受此见解启发,我们开发了一种利用 PEFT 的投毒样本识别模块 (PSIM),该模块通过置信度识别投毒样本,从而对权重投毒后门攻击提供鲁棒的防御。具体而言,我们利用 PEFT 训练 PSIM,并使用随机重置的样本标签。在推理过程中,极端置信度作为投毒样本的指标,而其他样本则为干净样本。我们在文本分类任务、五种微调策略和三种权重投毒后门攻击方法上进行了实验。实验表明,利用 PEFT 时权重投毒后门攻击的成功率接近 100%。此外,我们的防御方法在缓解权重投毒后门攻击方面表现出整体具有竞争力的性能。

关键词

引用

@article{arxiv.2402.12168,
  title  = {Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning},
  author = {Shuai Zhao and Leilei Gan and Luu Anh Tuan and Jie Fu and Lingjuan Lyu and Meihuizi Jia and Jinming Wen},
  journal= {arXiv preprint arXiv:2402.12168},
  year   = {2024}
}

备注

NAACL Findings 2024