削枝图谱:优化隐蔽越狱提示生成以提升LLM内容审核
密码学与安全
2025-11-14 v3 人工智能
计算与语言
摘要
随着大型语言模型(LLM)的广泛应用,确保其对对抗性滥用的鲁健性至关重要。本文引入了GAP(Graph of Attacks with Pruning)框架,这是一种用于生成隐蔽越狱提示以评估和增强LLM安全措施的先进方法。GAP通过实施 interconnected的图结构,使攻击路径之间能够共享知识,从而克服了现有基于树的LLM越狱方法的局限性。我们的实验评估表明,GAP在现有技术之上取得了优势,攻击成功率提高了20.8%,查询成本降低了62.7%。GAP在针对开放和封闭LLM时均表现出色,攻击成功率均超过96%。此外,我们还提出了专用变体,如GAP-Auto用于自动生成种子提示,GAP-VLM用于多模态攻击。GAP生成的提示在改进内容审核系统方面效果显著,将真阳性检测率提高了108.5%,准确率提高了183.6%。我们的实现已公开:https://github.com/dsbuddy/GAP-LLM-Safety。
引用
@article{arxiv.2501.18638,
title = {Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation},
author = {Daniel Schwartz and Dmitriy Bespalov and Zhe Wang and Ninad Kulkarni and Yanjun Qi},
journal= {arXiv preprint arXiv:2501.18638},
year = {2025}
}
备注
14 pages, 5 figures; published in EMNLP 2025 ; Code at: https://github.com/dsbuddy/GAP-LLM-Safety