中文

隐藏于明处:一种用于隐蔽LLM越狱攻击的隐写术方法

密码学与安全 2026-03-13 v2 人工智能

摘要

越狱攻击通过绕过大型语言模型(LLM)的安全机制,对其构成严重威胁。一个真正先进的越狱攻击不仅以其有效性来定义,更关键的是以其隐蔽性来定义。然而,现有方法在语义隐蔽性(隐藏恶意意图)与语言隐蔽性(呈现自然性)之间存在根本性的权衡,使其容易受到检测。为了解决这一权衡,我们提出了StegoAttack,一个利用隐写术的框架。其核心思想是将恶意查询嵌入到一个良性的、语义连贯的段落中。这种设计通过隐藏恶意内容的存在来提供语义隐蔽性,并通过保持覆盖段落的自然流畅性来确保语言隐蔽性。我们在四种最先进的、与安全对齐的LLM上评估了StegoAttack,包括GPT-5和Gemini-3,并将其与八种领先的越狱方法进行了基准对比。我们的结果表明,StegoAttack在所有四个模型上实现了平均95.50%的攻击成功率(ASR),超越了现有基线。关键的是,在外部检测器下,其ASR下降幅度小于27.00%,同时保持了自然语言分布。这表明隐写术有效地将语言隐蔽性与语义隐蔽性解耦,从而构成一个完全隐藏但极具有效的安全威胁。代码可在 https://github.com/GenggengSvan/StegoAttack 获取。

关键词

引用

@article{arxiv.2505.16765,
  title  = {Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks},
  author = {Jianing Geng and Biao Yi and Zekun Fei and Ruiqi He and Lihai Nie and Tong Li and Zheli Liu},
  journal= {arXiv preprint arXiv:2505.16765},
  year   = {2026}
}