去芜存菁:一种针对微调语言模型的事后安全重对齐方法
计算与语言
2025-05-27 v3
摘要
尽管大语言模型(LLM)在发布时实现了有效的安全对齐,但它们仍面临各种安全挑战。一个关键问题是,微调往往会损害 LLM 的安全对齐。为了解决这个问题,我们提出了一种名为 IRR(Identify, Remove, and Recalibrate for Safety Realignment,即识别、移除和重新校准以实现安全重对齐)的方法,对 LLM 执行安全重对齐。IRR 的核心是从微调模型中识别并移除不安全的 delta 参数,同时重新校准保留的参数。我们在包括全微调和 LoRA 方法在内的各种数据集上评估了 IRR 的有效性。我们的结果表明,IRR 在有害查询和越狱攻击等安全基准上显著提升了微调模型的安全性能,同时保持了它们在下游任务上的性能。源代码可在以下地址获取:https://anonymous.4open.science/r/IRR-BD4F。
引用
@article{arxiv.2412.11041,
title = {Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models},
author = {Di Wu and Xin Lu and Yanyan Zhao and Bing Qin},
journal= {arXiv preprint arXiv:2412.11041},
year = {2025}
}
备注
16 pages, 14 figures. Camera-ready for ACL2025 findings