安全对齐不应仅停留在几个词元的深度
密码学与安全
2024-06-11 v1 人工智能
摘要
当前大型语言模型(LLM)的安全对齐是脆弱的。相对简单的攻击,甚至良性的微调,都可以越狱已对齐的模型。我们认为,这些漏洞中有许多都与一个共同的潜在问题有关:安全对齐可能走捷径,其中对齐主要仅在其最初的几个输出词元上调整模型的生成分布。我们将此问题称为浅层安全对齐。在本文中,我们通过案例研究解释了为什么浅层安全对齐可能存在,并提供了证据表明当前已对齐的LLM存在此问题。我们还展示了这些发现如何帮助解释LLM中最近发现的多个漏洞,包括对对抗性后缀攻击、预填充攻击、解码参数攻击和微调攻击的敏感性。重要的是,我们讨论了这种整合的浅层安全对齐概念如何为减轻这些漏洞的有前景的研究方向提供启示。例如,我们表明,将安全对齐加深到仅前几个词元之外,通常可以显著提高对某些常见漏洞利用的鲁棒性。最后,我们设计了一个正则化的微调目标,通过约束初始词元上的更新,使安全对齐对微调攻击更具持久性。总的来说,我们主张未来的安全对齐不应仅停留在几个词元的深度。
引用
@article{arxiv.2406.05946,
title = {Safety Alignment Should Be Made More Than Just a Few Tokens Deep},
author = {Xiangyu Qi and Ashwinee Panda and Kaifeng Lyu and Xiao Ma and Subhrajit Roy and Ahmad Beirami and Prateek Mittal and Peter Henderson},
journal= {arXiv preprint arXiv:2406.05946},
year = {2024}
}