中文

LoRA 微调高效消除 Llama 2-Chat 70B 的安全训练

机器学习 2024-05-24 v2 人工智能

摘要

AI 开发者通常应用安全对齐程序以防止其 AI 系统被滥用。例如,在 Meta 发布 Llama 2-Chat(一组指令微调大语言模型)之前,他们在安全训练上投入巨大,结合了广泛的红队测试和人类反馈强化学习。我们通过颠覆性地微调 Llama 2-Chat 来探究语言模型中安全训练的鲁棒性。我们采用量化低秩适配(LoRA)作为高效的微调方法。在不到 $200 的预算且仅使用一块 GPU 的情况下,我们成功消除了 7B、13B 和 70B 尺寸的 Llama 2-Chat 模型以及 Mixtral instruct 模型的安全训练。具体而言,我们的微调技术显著降低了模型拒绝遵循有害指令的比率。在两个拒绝基准上,我们的 70B Llama 2-Chat 模型实现了约 1% 的拒绝率。同时,我们的方法在两个通用性能基准上保持了能力。我们表明颠覆性微调是切实且有效的,并因此主张将微调风险的评估作为发布模型权重风险评估的核心部分。尽管对当前模型风险范围存在相当大的不确定性,但未来的模型将具有显著更危险的能力。

关键词

引用

@article{arxiv.2310.20624,
  title  = {LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B},
  author = {Simon Lermen and Charlie Rogers-Smith and Jeffrey Ladish},
  journal= {arXiv preprint arXiv:2310.20624},
  year   = {2024}
}