中文

基于说服技巧的迭代提示在越狱大语言模型中的应用

计算与语言 2025-03-27 v1 人工智能 新兴技术

摘要

大型语言模型(LLM)旨在根据人类价值观来指导其响应。本研究利用迭代提示技术攻击 LLM,该技术通过对每个提示进行系统性修改和细化,以逐步增强其在越狱攻击中的有效性。该技术涉及分析 LLM 的响应模式,包括 GPT-3.5、GPT-4、LLaMa2、Vicuna 和 ChatGLM,从而调整和优化提示,以规避 LLM 的伦理和安全约束。说服策略既增强提示的有效性,又保持与恶意意图的一致性。我们的结果表明,随着攻击性提示逐步细化,攻击成功率(ASR)不断提高,GPT-4 和 ChatGLM的最高 ASR 达到 90%,LLaMa2 的最低 ASR 达到 68%。本技术在 ASR 上优于基线技术(PAIR 和 PAP),与 GCG 和 ArtPrompt 性能相当。

关键词

引用

@article{arxiv.2503.20320,
  title  = {Iterative Prompting with Persuasion Skills in Jailbreaking Large Language Models},
  author = {Shih-Wen Ke and Guan-Yu Lai and Guo-Lin Fang and Hsi-Yuan Kao},
  journal= {arXiv preprint arXiv:2503.20320},
  year   = {2025}
}