关于大语言模型的提示驱动安全防护研究
机器学习
2024-06-04 v4 人工智能
计算与语言
摘要
在模型输入前添加安全提示是保护大语言模型 (LLM) 免受有害意图查询的常见做法。然而,安全提示的底层工作机制尚未被揭示,这限制了自动优化它们以提升 LLM 安全性的可能性。在这项工作中,我们从模型表示的角度研究了 LLM 的行为(即遵从或拒绝用户查询)如何受到安全提示的影响。我们发现,在表示空间中,安全提示通常会将输入查询推向一个“更高拒绝”的方向,使得模型更倾向于拒绝提供帮助,即使查询是无害的。另一方面,LLM 在没有安全提示的情况下,天生具备区分有害和无害查询的能力。受这些发现的启发,我们提出了一种安全提示优化方法,即 DRO(定向表示优化)。DRO 将安全提示视为连续的、可训练的嵌入,根据查询的有害性,学习将查询的表示沿着或逆着拒绝方向移动。在八个 LLM 上进行的域外和越狱基准测试实验表明,DRO 显著提升了人工设计的安全提示的防护性能,同时没有损害模型的通用性能。
引用
@article{arxiv.2401.18018,
title = {On Prompt-Driven Safeguarding for Large Language Models},
author = {Chujie Zheng and Fan Yin and Hao Zhou and Fandong Meng and Jie Zhou and Kai-Wei Chang and Minlie Huang and Nanyun Peng},
journal= {arXiv preprint arXiv:2401.18018},
year = {2024}
}
备注
ICML 2024