中文

SaLoRA:保持安全对齐的低秩适配

机器学习 2025-01-06 v1

摘要

随着大型语言模型(LLM)的不断进步以及对个性化模型需求的增加,参数高效微调(PEFT)方法(如 LoRA)因其在降低计算成本方面的效率优势,将变得至关重要。然而,近期研究提出了令人担忧的担忧,即 LoRA 微调可能在某种程度上损害 LLM 的安全对齐,从而对模型所有者构成重大风险。本文首先通过分析微调前后与安全对齐相关特征的变化,来探讨其背后的机制。随后,我们提出一种由安全数据计算得到的固定安全模块,以及用于低秩适配中可训练参数的任务特定初始化,称为 Safety-alignment preserved Low-Rank Adaptation(保持安全对齐的低秩适配,SaLoRA)。与以往的 LoRA 方法及其变体不同,SaLoRA 能够在不破坏原始对齐的前提下,对 LLM 进行有针对性的修改。我们的实验表明,在各种微调任务中,SaLoRA 在多种评估指标上均优于各种基于适配器的方法。

关键词

引用

@article{arxiv.2501.01765,
  title  = {SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation},
  author = {Mingjie Li and Wai Man Si and Michael Backes and Yang Zhang and Yisen Wang},
  journal= {arXiv preprint arXiv:2501.01765},
  year   = {2025}
}