中文

面向 大语言模型 的结构化 语义 隐蔽 机制

计算与语言 2026-03-18 v1

摘要

现代大语言模型采用超越表面级输入过滤的安全机制,涵盖潜在语义表示和生成时推理,使其能够在推理期间恢复被掩盖的恶意意图并予以拒绝,从而使许多表面级隐蔽攻击式的越狱攻击变得无效。我们提出结构化语义隐蔽 (S2C),一种新型的多维度越狱攻击框架,通过操控恶意语义意图在模型推理期间的重构方式来实现攻击。S2C 战略性地分布和重构语义线索,使得完整的意图整合需要在更深层的潜在表示中进行多步骤推理和长程指代解析。该框架包含三个互补机制:(1) 上下文 重构,将请求嵌入一个看似 高风险 的情景中,以偏向模型顺从;(2) 内容 碎片化,将请求的语义 特征 分散到不相连的提示片段中;(3) 信息引导 隐蔽,将残余语义线索 伪装 成看似 合理 的形式,同时嵌入可恢复的 标记 以指导 输出 生成。通过延迟 和 重构 语义 整合,S2C 削弱了依赖于解码时 一致 或 显式 重构恶意意图的安全触发器,同时保留足够的 指令 可恢复性 以实现功能性 输出 生成。我们在多个开源 和 专有 大语言模型 上使用 HarmBench 和 JBB-Behaviors 进行评估,其中它在两个基准上的攻击成功率 (ASR) 分别提高了 12.4% 和 9.7%。值得注意的是,S2C 在 GPT-5-mini 上表现突出,相较于最强的基线在 JBB-Behaviors 上 outperform by 26%。我们还分析了哪些组合对广泛的模型族最为有效,并刻画了 隐蔽程度 与 输入 可恢复性 之间的 越狱 成功 的 权衡。

关键词

引用

@article{arxiv.2603.16192,
  title  = {Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models},
  author = {Xiaobing Sun and Perry Lam and Shaohua Li and Zizhou Wang and Rick Siow Mong Goh and Yong Liu and Liangli Zhen},
  journal= {arXiv preprint arXiv:2603.16192},
  year   = {2026}
}

备注

15 pages