中文

RoguePrompt:双层密码化用于自我重构以规避 LLM Moderation

密码学与安全 2026-01-06 v2

摘要

大语言模型(LLMs)正逐渐深度融入主流开发平台和日常技术工作流程,通常置于 moderation 和安全控制之后。尽管如此,防止基于提示的政策规避仍然具有挑战性,敌对者通过精心设计的提示继续对 LLM 进行越狱。虽然先前的越狱技术探索了混淆和情境操纵,但许多以单步骤转换形式运作,其效果在当前最先进模型上不一致。这留下了对多阶段提示转换攻击的有限理解,这些攻击规避 moderation、重构禁止意图并触发违规输出。本文引入 RoguePrompt,一套自动化越狱管道,利用双层提示转换将禁止提示转换为规避安全查询。通过将禁止提示分区,并沿用 ROT-13 和 Vigenère 编码以及自然语言解码指令的两层嵌套编码,产生外观善意的提示,以规避过滤器并在单个查询中诱导模型执行原始提示。RoguePrompt 在黑盒威胁模型下开发和评估,仅具备对 LLM 的 API 和 UI 访问权限,并在 313 个真实世界硬性被拒的提示上进行测试。成功率以规避 moderation、指令重构和执行为度量,采用自动化和人类评估两种方式。在多个前沿 LLM 上,RoguePrompt 实现了平均 93.93% 的过滤规避率、79.02% 的重构率和 70.18% 的执行成功率。这些结果表明了分层提示编码的有效性,凸显了检测和缓解自我重构式越狱的必要性。

关键词

引用

@article{arxiv.2511.18790,
  title  = {RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation},
  author = {Benyamin Tafreshian},
  journal= {arXiv preprint arXiv:2511.18790},
  year   = {2026}
}

备注

This manuscript has been submitted for consideration to the ACM Conference on Data and Application Security and Privacy (CODASPY) 2026