通过对比安全与有害分布实现大型语言模型的安全对齐
计算与语言
2025-12-16 v2
摘要
随着大型语言模型(LLM)的广泛应用,确保其安全性并防止有害响应已成为重要 concern。虽然基于指令微调和基于人类反馈的强化学习(RLHF)的当前安全对齐方法可以有效减少 LLM 的有害响应,但它们通常需要高质量的数据集,并且在模型训练期间计算开销很大。另一种对齐语言模型的方法是无需 heavy training 即可修改模型输出中 token 的 logit。最近的研究表明,对比解码可以提高语言模型的性能,降低混淆 token 的可能性。然而,这些方法需要手动选择对比模型或指令模板,限制了对比的程度。为此,我们提出了对抗性对比解码(Adversarial Contrastive Decoding, ACD),一个基于优化的框架,用于生成两个相反的软系统提示:保护提示(Safeguarding Prompt, SP)和对抗提示(Adversarial Prompt, AP),用于基于提示的对比解码。SP 旨在促进更安全的输出,而 AP 旨在挖掘模型的有害部分,从而提供强大的对比以实现模型的安全对齐。ACD 只需要在较小的锚数据集上进行轻量级提示调优,而无需训练目标模型。在广泛的模型和基准测试上进行的实验表明,所提出的方法在不牺牲原始生成能力的情况下,优于以往模型训练-free 解码方法,实现了更好的安全性能。
引用
@article{arxiv.2406.16743,
title = {Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions},
author = {Xiaoyun Zhang and Zhengyue Zhao and Wenxuan Shi and Kaidi Xu and Di Huang and Xing Hu},
journal= {arXiv preprint arXiv:2406.16743},
year = {2025}
}