通过人格提示提升LLM越狱攻击的效果
密码学与安全
2026-03-26 v3 人工智能
摘要
越狱攻击旨在通过诱导大语言模型(LLM)生成有害内容,从而揭示其漏洞。理解和解决这些攻击对于推动LLM安全领域的发展至关重要。以往的越狱方法主要关注对有害意图的直接操控,较少关注人格提示的影响。本研究系统性地探讨了人格提示在削弱LLM防御方面的有效性。我们提出了一种基于遗传算法的方法,自动 crafting 人格提示以规避LLM的安全机制。我们的实验结果显示:(1)这些进化后的人格提示在多个LLM模型上将拒绝率降低50%-70%;(2)这些提示与现有攻击方法组合时显示出协同效应,成功率提高10%-20%。我们的代码和数据已公开于 https://github.com/CjangCjengh/Generic_Persona。
引用
@article{arxiv.2507.22171,
title = {Enhancing Jailbreak Attacks on LLMs via Persona Prompts},
author = {Zheng Zhang and Peilin Zhao and Deheng Ye and Hao Wang},
journal= {arXiv preprint arXiv:2507.22171},
year = {2026}
}
备注
Workshop on LLM Persona Modeling at NeurIPS 2025