大型推理模型何时会超越自身安全性:揭示并缓解自我越狱现象
人工智能
2026-04-27 v4 计算与语言
摘要
大型推理模型 (LRM) 在复杂的多步骤推理任务中取得了强大的性能,但仍 exhibit 严重的安全失效,如有害内容生成。现有方法通常对整个推理轨迹施加粗糙约束,这既会削弱推理能力,又无法解决不安全行为的根本原因。在本工作中,我们揭示了 LRMs 中一个此前鲜有人知的失效模式,称为 Self-Jailbreak,即模型最初识别查询的有害意图,但在后续推理步骤中覆盖了这一判断,最终生成不安全的输出。这种现象表明 LRMs 具备识别危险的能力,而安全失效主要源于推理步骤。鼓励此发现,我们提出了 Chain-of-Guardrail (CoG),一种在保持推理能力的同时,通过针对性的步骤级干预来缓解 Self-Jailbreak 的轨迹级训练框架。在多个安全和推理基准测试中进行实验表明,CoG 在安全性和推理性能之间取得了与现有方法相比有利的平衡。
引用
@article{arxiv.2510.21285,
title = {When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models},
author = {Yingzhi Mao and Chunkang Zhang and Junxiang Wang and Xinyan Guan and Boxi Cao and Yaojie Lu and Hongyu Lin and Xianpei Han and Le Sun},
journal= {arXiv preprint arXiv:2510.21285},
year = {2026}
}
备注
ACL 2026. The first two authors contributed equally. The main text is 9 pages, with an appendix of 28 pages. The paper contains 20 figures and 15 tables