NLSR:针对有害微调的大语言模型神经元级安全重对齐
计算与语言
2024-12-18 v1
摘要
微调即服务的出现暴露了大语言模型(LLM)的一个新漏洞。用户上传的极少量恶意数据即可暗中操纵微调过程,导致模型的对齐被破坏。现有的对抗微调攻击的方法通常需要大量的计算资源。即使采用 LoRA 等参数高效技术,梯度更新仍然是必不可少的。为了应对这些挑战,我们提出了神经元级安全重对齐(NLSR),这是一种无需训练的框架,它基于微调前后安全关键神经元的相似性差异来恢复 LLM 的安全性。我们框架的核心是首先从初始对齐模型构建一个安全参考模型,以放大神经元中与安全相关的特征。然后,我们利用该参考模型识别安全关键神经元,并将其准备为补丁。最后,我们通过移植这些准备好的补丁,选择性地仅恢复那些表现出显著相似性差异的神经元,从而以最小程度改变微调后的模型。大量实验表明,在多个下游任务的微调模型中,安全性得到了显著提升,同时较好地保持了任务级准确率。我们的研究结果表明,部分安全关键神经元的区域在微调后表现出明显差异,这可以通过从参考模型移植神经元来有效纠正,而无需额外训练。代码将在 https://github.com/xinykou/NLSR 上提供。
引用
@article{arxiv.2412.12497,
title = {NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning},
author = {Xin Yi and Shunfan Zheng and Linlin Wang and Gerard de Melo and Xiaoling Wang and Liang He},
journal= {arXiv preprint arXiv:2412.12497},
year = {2024}
}