中文

Vaccine:针对有害微调攻击的大语言模型扰动感知对齐方法

机器学习 2024-11-26 v6 计算与语言

摘要

微调即服务的新范式为大型语言模型(LLMs)引入了一个新的攻击面:用户上传的少量有害数据即可轻易诱使微调过程产生对齐失效的模型。我们通过实证分析揭示了一种“有害嵌入漂移”现象,该现象可能是导致对齐失效效应的一个原因。受此发现启发,我们提出了Vaccine,一种扰动感知的对齐技术,以缓解用户微调带来的安全风险。Vaccine的核心思想是在对齐阶段,通过向嵌入中逐步添加精心设计的扰动,使其产生不变性,从而使这些嵌入能够在微调阶段抵御来自未净化用户数据的有害扰动。我们在开源主流LLMs(例如Llama2、Opt、Vicuna)上的结果表明,Vaccine能够提升对齐的鲁棒性,抵御有害提示诱导的嵌入漂移,同时保留对良性提示的推理能力。我们的代码可在\url{https://github.com/git-disl/Vaccine}获取。

关键词

引用

@article{arxiv.2402.01109,
  title  = {Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack},
  author = {Tiansheng Huang and Sihao Hu and Ling Liu},
  journal= {arXiv preprint arXiv:2402.01109},
  year   = {2024}
}

备注

Rejected by ICML2024. Accepted by NeurIPS2024