大规模推理模型是自主越狱代理
计算与语言
2026-02-10 v1 人工智能
密码学与安全
摘要
越狱——绕过AI模型内置的安全机制——传统上需要复杂的技术程序或专业的人类专业知识。本研究显示,大规模推理模型(LRM)的说服能力简化并扩展了越狱,将其转化为一种可被非专业人士轻松获取的低成本活动。我们评估了四个 LRM(DeepSeek-R1、Gemini 2.5 Flash、Grok 3 Mini、Qwen3 235B)作为自主对手进行多轮对话的能力,这些对手与九个广泛使用的目标模型进行交互。LRM 接收系统提示后,进行规划并执行越狱,无需进一步监督。我们使用包含70个涵盖七个敏感领域的有害提示基准进行了大量实验。该设置下,所有模型组合的整体攻击成功率为97.14%。我们的研究揭示了一种对齐退化现象,即 LRM 能够系统性地削弱其他模型的安全护栏,凸显了迫切需要进一步对齐前沿模型的紧迫性,不仅要抵御越狱尝试,还要防止它们被用作越狱代理。
引用
@article{arxiv.2508.04039,
title = {Large Reasoning Models Are Autonomous Jailbreak Agents},
author = {Thilo Hagendorff and Erik Derner and Nuria Oliver},
journal= {arXiv preprint arXiv:2508.04039},
year = {2026}
}