LLM 自我防御:通过自我审查,LLM 知晓自己正被欺骗
计算与语言
2024-05-03 v4 人工智能
摘要
大语言模型(LLMs)因高质量文本生成而流行,但即便通过强化学习与人类价值对齐,仍可能产生有害内容。对抗性提示可绕过其安全措施。我们提出 LLM 自我防御,一种通过让 LLM 筛查所诱导响应来抵御此类攻击的简单方法。我们的方法无需任何微调、输入预处理或迭代输出生成。相反,我们将生成内容嵌入预定义提示,并采用另一 LLM 实例分析文本并预测其是否有害。我们在 GPT 3.5 与 Llama 2 这两款当前最突出的 LLM 上测试 LLM 自我防御,针对各类攻击如强制诱导肯定响应与提示工程攻击。值得注意的是,LLM 自我防御使用 GPT 3.5 与 Llama 2 均将攻击成功率降至近乎 0。代码公开于 https://github.com/poloclub/llm-self-defense
引用
@article{arxiv.2308.07308,
title = {LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked},
author = {Mansi Phute and Alec Helbling and Matthew Hull and ShengYun Peng and Sebastian Szyller and Cory Cornelius and Duen Horng Chau},
journal= {arXiv preprint arXiv:2308.07308},
year = {2024}
}