中文

Safe LoRA:降低大语言模型微调安全风险的希望之光

机器学习 2025-01-07 v2

摘要

尽管诸如 Llama-2 或 GPT-4 等大语言模型(LLM)展现出了令人瞩目的零样本性能,但仍需通过微调来提升其在定制数据集、特定领域任务或其他私有需求上的表现。然而,微调 LLM 的所有参数需要大量硬件资源,这对普通用户而言可能并不现实。因此,诸如 LoRA 等参数高效微调方法应运而生,允许用户在无需大量计算资源的情况下对 LLM 进行微调,且与微调所有参数相比性能下降甚微。不幸的是,近期研究表明,即使数据不包含恶意内容,微调也可能增加 LLM 的安全风险。为应对这一挑战,我们提出了 Safe LoRA,这是一种对原始 LoRA 实现的简单单行补丁,通过将选定层的 LoRA 权重投影到安全对齐子空间,在保持实用性的同时有效降低了 LLM 微调中的安全风险。值得注意的是,Safe LoRA 是一种免训练且免数据的方法,因为它仅需基础 LLM 和已对齐 LLM 的权重知识。我们的大量实验表明,当在纯恶意数据上进行微调时,Safe LoRA 保持了与原始对齐模型相似的安全性能。此外,当微调数据集包含良性与恶意数据的混合时,Safe LoRA 在保持下游任务性能的同时减轻了恶意数据带来的负面影响。我们的代码可在 \url{https://github.com/IBM/SafeLoRA} 获取。

关键词

引用

@article{arxiv.2405.16833,
  title  = {Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models},
  author = {Chia-Yi Hsu and Yu-Lin Tsai and Chih-Hsun Lin and Pin-Yu Chen and Chia-Mu Yu and Chun-Ying Huang},
  journal= {arXiv preprint arXiv:2405.16833},
  year   = {2025}
}

备注

This is the camera-ready version accepted for NeurIPS 2024