Panacea:通过后微调扰动缓解大型语言模型有害微调
计算与语言
2026-01-19 v2 人工智能
摘要
有害微调攻击对微调服务构成重大安全风险。主流防御方法旨在为模型接种疫苗,以便后续有害微调攻击效果较小。然而,我们的评估结果表明,这些防御措施脆弱不堪——经过少数微调步骤后,模型仍可学习有害知识。为此,我们进一步实验发现,一个极其简单粗暴的解决方案——添加纯粹随机扰动,可恢复模型以避免有害行为,尽管这会导致模型在微调性能上出现下降。为解决微调性能下降的问题,我们进一步提出 Panacea,通过优化自适应扰动应用于模型后完成微调。Panacea 在不损害下游微调性能的前提下,维持模型的安全对齐性能。对不同有害比例、微调任务和主流 LLM 进行全面实验,其中有害得分降低最高可达 21.2%,同时保持微调性能。作为副产品,我们分析了自适应扰动,显示不同层在各种 LLM 中的安全亲和性各不相同,这与数项先前研究的发现相符。源代码可在 https://github.com/w-yibo/Panacea 获取。
引用
@article{arxiv.2501.18100,
title = {Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation},
author = {Yibo Wang and Tiansheng Huang and Li Shen and Huanjin Yao and Haotian Luo and Rui Liu and Naiqiang Tan and Jiaxing Huang and Dacheng Tao},
journal= {arXiv preprint arXiv:2501.18100},
year = {2026}
}
备注
Accepted by NeruIPS 2025