意图分析使大语言模型成为优秀的越狱防御者
计算与语言
2024-12-17 v4
摘要
将大语言模型(LLMs)与人类价值观对齐,尤其是在面对复杂且隐蔽的越狱攻击时,是一项艰巨的挑战。不幸的是,现有方法常常忽视了越狱的这种内在特性,这限制了它们在复杂场景下的有效性。在本研究中,我们提出了一种简单却高效的防御策略,即意图分析()。 通过一个两阶段过程触发LLMs固有的自我纠正与改进能力:1)分析用户输入的本质意图,以及2)基于第一轮对话提供最终符合策略的响应。值得注意的是, 是一种仅推理方法,因此可以在不损害LLMs有用性的前提下增强其安全性。在广泛的LLMs上针对不同越狱基准进行的大量实验表明, 能够持续且显著地降低响应中的有害性(平均攻击成功率降低48.2%)。令人鼓舞的是,借助我们的,Vicuna-7B在攻击成功率方面甚至优于GPT-3.5。我们通过实验证明,在一定程度上, 对生成的意图中的错误具有鲁棒性。进一步的分析揭示了 的基本原理:抑制LLM遵循越狱提示的倾向,从而增强安全性。
引用
@article{arxiv.2401.06561,
title = {Intention Analysis Makes LLMs A Good Jailbreak Defender},
author = {Yuqi Zhang and Liang Ding and Lefei Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2401.06561},
year = {2024}
}
备注
COLING 2025