中文

PEFT-as-an-Attack!:在联邦参数高效微调期间劫持语言模型

密码学与安全 2024-12-20 v2 人工智能

摘要

联邦参数高效微调(FedPEFT)已成为在联邦学习(FL)环境中实现隐私保护和高效适配预训练语言模型(PLM)的有力方法。它通过保持数据分布式并在本地设备上训练模型,确保原始数据永远不离开用户设备,从而保留数据隐私。此外,集成诸如 LoRA 等 PEFT 方法可显著降低可训练参数数量,相较于对整个模型进行微调,从而最小化通信成本和计算开销。尽管已具备潜力,但 FedPEFT 的安全影响仍未得到充分探讨。本文引入一种新型对 FedPEFT 的安全威胁,称为 PEFT-as-an-Attack(PaaA),揭示了 PEFT 可被用作攻击向量,以规避 PLM 的安全对齐,生成恶意内容来响应恶意提示。我们的 PaaA 评估结果表明,仅需约 1% 的模型参数设为可训练,以及少数客户端恶意行为,即可实现约 80% 的攻击成功率,所采用的代表性 PEFT 方法包括 LoRA。为缓解此威胁,我们进一步探讨了潜在的防御策略,包括鲁棒聚合方案(RASs)和后 PEFT 安全对齐(PPSA)。然而,我们的实证分析凸显了这些防御措施的局限性,即使是最先进的 RASs,如 DnC 和 ClippedClustering,在数据分布高度异构的场景下也难以对抗 PaaA。类似地,虽然 PPSA 可将攻击成功率降至 10% 以下,但会严重降低模型在目标任务上的准确率。我们的结果凸显了迫切需要更有效的防御机制,以同时确保 FedPEFT 范式的安全性并维持其性能。

关键词

引用

@article{arxiv.2411.19335,
  title  = {PEFT-as-an-Attack! Jailbreaking Language Models during Federated Parameter-Efficient Fine-Tuning},
  author = {Shenghui Li and Edith C. -H. Ngai and Fanghua Ye and Thiemo Voigt},
  journal= {arXiv preprint arXiv:2411.19335},
  year   = {2024}
}