中文

模式增强的多轮越狱攻击:利用大型语言模型的结构性漏洞

计算与语言 2026-02-06 v2 人工智能 密码学与安全

摘要

大型语言模型(LLM)仍然容易受到多轮越狱攻击,这些攻击利用对话上下文逐步绕过安全约束。这些攻击通过不同的对话方式针对不同的伤害类别。现有的多轮方法通常依赖启发式或临时探索策略,对底层模型弱点提供有限的洞察。对话模式与不同伤害类别中模型弱点之间的关系仍了解甚少。我们提出了模式增强攻击链(Pattern Enhanced Chain of Attack, PE-CoA),一个通过自然对话构建多轮越狱的五种对话模式框架。在十二个 LLM 上评估 PE-CoA,涵盖十个伤害类别,我们取得了最先进性能,揭示了模式特定的漏洞和 LLM 行为特征:模型表现出不同的弱点画像,对一种模式的防御不能泛化到其他模式,模型家族共享相似的失败模式。这些发现突显了安全训练的局限性,并表明需要模式感知的防御。代码可在 https://github.com/Ragib-Amin-Nihal/PE-CoA 获取。

关键词

引用

@article{arxiv.2510.08859,
  title  = {Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models},
  author = {Ragib Amin Nihal and Rui Wen and Kazuhiro Nakadai and Jun Sakuma},
  journal= {arXiv preprint arXiv:2510.08859},
  year   = {2026}
}