Lisa: 大语言模型的惰性安全对齐,以抵御有害微调攻击
机器学习
2024-10-30 v5
摘要
最近的研究表明,对大语言模型(LLM)进行安全对齐后,仍可通过在混合有害数据的微调数据集上进行微调来突破安全措施。首次在文献中我们展示,破解效应可通过分离微调阶段中的状态来缓解,从而分别优化对齐和用户数据集。不幸的是,我们随后发现,这种简单的双状态优化(BSO)方案在对齐状态的投入步骤过少时会出现收敛不稳定,导致对齐性能下降。通过统计分析,我们显示,向共识方向的"过度漂移"可能是导致不稳定的原因。为解决此问题,我们提出了Lazy(i)safetyalignment(Lisa),该方法引入一个近端项来约束每个状态的漂移。理论上,近端项的优势由收敛分析得到支持,其中我们证明,需要足够大的近端因子才能保证Lisa的收敛。实验上,我们在四个下游微调任务上显示,Lisa在近端项下可显著提高对齐性能,同时保持LLM在用户任务上的准确性。代码已在\url{https://github.com/git-disl/Lisa}上提供。
引用
@article{arxiv.2405.18641,
title = {Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack},
author = {Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Ling Liu},
journal= {arXiv preprint arXiv:2405.18641},
year = {2024}
}
备注
Accepted by NeurIPS2024. arXiv admin note: substantial text overlap with arXiv:2402.01109