中文

“道德化”多步骤越狱提示:大型语言模型 Verbal Attack 围栏的黑箱测试

密码学与安全 2025-03-21 v4 人工智能 计算与语言

摘要

随着大型语言模型在各领域的应用不断拓展,对识别有害内容生成和围栏机制的有效性提出了更高的挑战。本研究旨在通过黑箱测试看似伦理的多步骤越狱提示,评估GPT-4o、Grok-2 Beta、Llama 3.1(405B)、Gemini 1.5和Claude 3.5 Sonnet等模型围栏的有效性。通过设计模拟“企业中层管理者争取晋升”情景的相同多步骤提示,进行伦理攻击。数据结果显示,上述模型的围栏被绕过,生成了 Verbal Attack内容。Claude 3.5 Sonnet对多步骤越狱提示的抵抗力更为明显。为确保客观性,实验过程、黑箱测试代码以及增强型围栏代码已上传至GitHub仓库:\url{https://github.com/brucewang123456789/GeniusTrail.git}。

关键词

引用

@article{arxiv.2411.16730,
  title  = {"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks},
  author = {Libo Wang},
  journal= {arXiv preprint arXiv:2411.16730},
  year   = {2025}
}

备注

This paper has been submitted to Nature Machine Intelligence and OpenReview preprints. It has 7 pages of text, 3 figures, and 3 tables