基于说服技巧的迭代提示在越狱大语言模型中的应用
计算与语言
2025-03-27 v1 人工智能
新兴技术
摘要
大型语言模型(LLM)旨在根据人类价值观来指导其响应。本研究利用迭代提示技术攻击 LLM,该技术通过对每个提示进行系统性修改和细化,以逐步增强其在越狱攻击中的有效性。该技术涉及分析 LLM 的响应模式,包括 GPT-3.5、GPT-4、LLaMa2、Vicuna 和 ChatGLM,从而调整和优化提示,以规避 LLM 的伦理和安全约束。说服策略既增强提示的有效性,又保持与恶意意图的一致性。我们的结果表明,随着攻击性提示逐步细化,攻击成功率(ASR)不断提高,GPT-4 和 ChatGLM的最高 ASR 达到 90%,LLaMa2 的最低 ASR 达到 68%。本技术在 ASR 上优于基线技术(PAIR 和 PAP),与 GCG 和 ArtPrompt 性能相当。
引用
@article{arxiv.2503.20320,
title = {Iterative Prompting with Persuasion Skills in Jailbreaking Large Language Models},
author = {Shih-Wen Ke and Guan-Yu Lai and Guo-Lin Fang and Hsi-Yuan Kao},
journal= {arXiv preprint arXiv:2503.20320},
year = {2025}
}