SpatialJB:文本分布艺术如何成为 LLM 护栏的“越狱密钥”
密码学与安全
2026-01-15 v1
摘要
尽管大型语言模型(LLM)具有强大的功能,但它们仍然容易受到越狱攻击的影响,这是其安全地应用于实时网络的关键障碍。当前的商业 LLM 提供商部署了输出护栏来过滤有害输出,然而这些防御并非无懈可击。由于 LLM 依赖自回归的逐 token 推理,其语义表示对空间结构化扰动缺乏鲁棒性,例如在不同行、列或对角线上重新分配 token。利用 Transformer 的空间弱点,我们提出了 SpatialJB 来破坏模型的输出生成过程,使有害内容能够在未被检测到的情况下绕过护栏。在主流 LLM 上进行的全面实验获得了近 100% 的攻击成功率(ASR),证明了 SpatialJB 的高效性。即使在添加了 OpenAI Moderation API 等高级输出护栏后,SpatialJB 仍持续保持超过 75% 的成功率,以显著优势优于当前的越狱技术。SpatialJB 的提出暴露了当前护栏的一个关键弱点,并强调了空间语义的重要性,为推进 LLM 安全研究提供了新见解。为了防止潜在的滥用,我们还提出了针对 SpatialJB 的基线防御策略,并评估了它们在缓解此类攻击方面的有效性。攻击代码、基线防御和演示可在 https://anonymous.4open.science/r/SpatialJailbreak-8E63 获取。
引用
@article{arxiv.2601.09321,
title = {SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails},
author = {Zhiyi Mou and Jingyuan Yang and Zeheng Qian and Wangze Ni and Tianfang Xiao and Ning Liu and Chen Zhang and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2601.09321},
year = {2026}
}