中文

一只陷阱:通过链式迭代混乱作弄大型推理模型

密码学与安全 2025-06-04 v2 人工智能 计算与语言 机器学习

摘要

大型推理模型(LRMs)已显著超越传统大型语言模型(LLMs),其卓越的逻辑推理能力带来了更高的安全风险。当受到越狱攻击时,它们的能力可以生成更精准且有组织的内容,这可能造成更大的伤害。尽管一些研究声称推理能够使 LRMs 在现有 LLM 攻击下更安全,但它们忽略了推理过程本身的内在缺陷。为填补这一差距,我们提出了首个针对 LRMs 的越狱攻击,利用其源于先进推理能力的独特漏洞。具体而言,我们引入了 Chaos Machine,这是一个新型组件,用于以多样化的一对一映射转换攻击提示。由 Chaos Machine 生成的混乱映射被嵌入推理链中,这不仅增强了变异性和复杂性,也促进了更稳健的攻击。基于此,我们构建了 Mousetrap 框架,使攻击投射到类似非线性低样本空间中,具有不匹配的泛化增强。此外,由于更激烈的目标竞争,LRMs 逐渐保持不可预测的迭代推理惯性并陷入我们的陷阱。在我们的有毒数据集 Trotter 上,Mousetrap 对 o1-mini、Claude-Sonnet 和 Gemini-Thinking 的攻击成功率分别达到 96%、86% 和 98%。在 AdvBench、StrongREJECT 和 HarmBench 等基准测试上,针对以安全性著称的 Claude-Sonnet,Mousetrap 竟然实现了惊人的 87.5%、86.58% 和 93.13% 的成功率。注意:本文包含不适当、冒犯且有害的内容。

关键词

引用

@article{arxiv.2502.15806,
  title  = {A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos},
  author = {Yang Yao and Xuan Tong and Ruofan Wang and Yixu Wang and Lujundong Li and Liang Liu and Yan Teng and Yingchun Wang},
  journal= {arXiv preprint arXiv:2502.15806},
  year   = {2025}
}