安全剪枝LoRA:用于大语言模型适配中安全对齐的鲁棒距离引导剪枝
机器学习
2025-06-25 v1 人工智能
摘要
使用低秩适配(LoRA)微调大型语言模型(LLM)增强了适应性,同时降低了计算成本。然而,即使使用良性数据,微调也可能损害安全对齐,增加对有害输出的敏感性。现有的安全对齐方法难以捕捉复杂的参数偏移,导致次优的安全-效用权衡。为解决此问题,我们提出了安全剪枝LoRA(SPLoRA),一种新颖的基于剪枝的方法,选择性地移除削弱安全对齐的LoRA层,在保持性能的同时提高安全性。其核心是,我们引入了经验维度不敏感相似性度量(E-DIEM),该度量能有效检测LoRA适配模型中的安全错位。我们在使用良性和恶意数据混合微调以及纯良性数据集微调的LLM上进行了广泛实验,评估SPLoRA在效用、安全性和可靠性指标上的表现。结果表明,SPLoRA优于最先进的安全对齐技术,显著降低安全风险,同时保持或提高模型性能和可靠性。此外,SPLoRA减少了推理开销,使其成为部署更安全、更可靠的LLM的可扩展且高效的解决方案。代码可在https://github.com/AoShuang92/SPLoRA获取。
引用
@article{arxiv.2506.18931,
title = {Safe Pruning LoRA: Robust Distance-Guided Pruning for Safety Alignment in Adaptation of LLMs},
author = {Shuang Ao and Yi Dong and Jinwei Hu and Sarvapali Ramchurn},
journal= {arXiv preprint arXiv:2506.18931},
year = {2025}
}
备注
13 pages, 3 figures