中文

锁住微调型大语言模型的安全性

计算与语言 2024-10-15 v1

摘要

在针对特定下游任务进行微调以优化大语言模型(LLM)是常见的做法。然而,现有的安全对齐措施仅限制推理过程中的有害行为,对于微调期间的安全风险防控效果不足。令人警惕的是,仅通过10个有毒句子进行微调即可使模型遵循有害指令。我们引入SafetyLock,这是一种新的对齐干预方法,通过高效且可迁移的机制,在微调后维持模型的安全性。SafetyLock利用我们发现的事实:微调后的模型保留了与原始模型相似的安全相关激活表示。这一洞察使我们能够提取并提出的“Meta-SafetyLock”,即一组代表原始模型中与安全响应相关的关键激活模式的安全偏置方向。我们可以将这些方向普遍应用于微调后的模型以增强其安全性。通过在多个token维度上搜索激活方向,SafetyLock实现了更好的鲁棒性和可迁移性。SafetyLock在0.01秒内完成重新对齐,且无需额外计算成本。我们的实验表明,SafetyLock可将有毒指令响应率从60%降至1%以下。它在性能和效率上均优于传统方法,提供了一种可扩展且非侵入性的解决方案,确保定制化LLM的安全性。我们在各种微调场景下的分析均确认SafetyLock的鲁棒性,倡导将其集成到对齐LLM的安全协议中。代码已发布于 https://github.com/zhu-minjun/SafetyLock。

关键词

引用

@article{arxiv.2410.10343,
  title  = {Locking Down the Finetuned LLMs Safety},
  author = {Minjun Zhu and Linyi Yang and Yifan Wei and Ningyu Zhang and Yue Zhang},
  journal= {arXiv preprint arXiv:2410.10343},
  year   = {2024}
}