中文

Antidote:针对有害微调的大语言模型后微调安全对齐

人工智能 2025-09-08 v3 密码学与安全

摘要

安全对齐的大语言模型(LLM)可能遭受有害微调攻击——即使在微调数据集中掺入少量有害数据,也可能破坏 LLM 的安全对齐。虽然已提出多种防御措施,但我们的评估显示,现有防御措施在某些特定训练超参数被选择时会失败——即在微调阶段使用较大的学习率或较大的训练 epoch 数也会轻易使防御失效。为此,我们提出了 Antidote,一种后微调阶段的解决方案,其对微调阶段的训练超参数保持\textbf{\textit{无关}。}Antidote 的理念是通过移除有害参数,可以从有害行为中恢复受损模型,这些有害参数是如何在微调阶段形成的并不重要。基于此理念,我们在有害微调后引入一个一次性修剪阶段,以移除负责生成有害内容的有害权重。尽管这方法看起来简单而尴尬,但实验结果表明,Antidote 能在保持下游任务准确性的同时降低有害得分。代码已公开于 https://github.com/git-disl/Antidote。

关键词

引用

@article{arxiv.2408.09600,
  title  = {Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning},
  author = {Tiansheng Huang and Gautam Bhattacharya and Pratik Joshi and Josh Kimball and Ling Liu},
  journal= {arXiv preprint arXiv:2408.09600},
  year   = {2025}
}

备注

Rejected by AAAI25-AIA. Accepted by ICML25. Authors are thankful to the anonymous reviewers from both AAAI25-AIA and ICML25