面向安全 LLM 微调的梯度手术
计算与语言
2025-08-12 v1
摘要
Fine-tuning-as-a-Service 引入了一个关键漏洞,少量恶意示例混入用户微调数据集中会捐害大型语言模型(LLM)的安全对齐。虽然已知安全微调被视为平衡用户任务性能与安全对齐的多目标优化问题,但我们发现现有 solution 对有害比例极其敏感,随着有害比例增加,防御机制会急剧下降。我们诊断到这一失败源于冲突梯度,用户任务的更新直接削弱了安全目标。为解决此问题,我们提出 SafeGrad,一种新方法采用梯度手术。当检测到冲突时,SafeGrad 通过将用户任务梯度的有害分量投影到 alignment 梯度的正交平面上来 nullify 该有害分量,使模型能够在不牺牲安全性的前提下学习用户的任务。为进一步增强鲁棒性和数据效率,我们采用 KL 散度 alignment loss,学习 well-aligned 基础模型的丰富、分布式的安全轮廓。广泛的实验表明,SafeGrad 在各种 LLMs 和数据集上提供了最先进的防御,即使在高有害比例下也能保持 robust safety 而不牺牲 task fidelity。
引用
@article{arxiv.2508.07172,
title = {Gradient Surgery for Safe LLM Fine-Tuning},
author = {Biao Yi and Jiahao Li and Baolei Zhang and Lihai Nie and Tong Li and Tiansheng Huang and Zheli Liu},
journal= {arXiv preprint arXiv:2508.07172},
year = {2025}
}