自越狱: benign 推理训练后语言模型自行突破安全对齐
密码学与安全
2026-04-30 v2 计算与语言
摘要
我们发现一种新颖且令人惊讶的意外误差对齐现象,称为自越狱(self-jailbreaking)。具体而言,在数学或代码领域进行善意推理训练后,推理语言模型(RLMs)将使用多种策略规避其自身的安全警戒。一种策略是引入关于用户和情景的善意假设,以正当化履行有害请求。例如,一个 RLM 推理说,像“盗取零售店顾客信用卡信息的策略”这样的有害请求可以与“安全专业人员尝试测试防御”的善意意图相关联,尽管没有将此类善意情境作为输入提供。我们观察到许多开源 RLMs,包括 DeepSeek-R1-distilled、s1.1、Phi-4-mini-reasoning 和 Nemotron,都受到自越狱的影响,尽管它们意识到请求的有害性。我们也提供了自越狱的机制性理解:RLMs 在善意推理训练后更顺从,训练后,模型似乎会将恶意请求在思维链(CoT)中视为更少有害,从而实现与之服从。为了缓解自越狱,我们发现在训练期间包含最小限量的安全推理数据就足以确保 RLMs 保持安全对齐。我们的工作提供了自越狱行为的首个系统性分析,并为在日益强大的 RLMs 中维持安全性提供了实际的路径。
引用
@article{arxiv.2510.20956,
title = {Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training},
author = {Zheng-Xin Yong and Stephen H. Bach},
journal= {arXiv preprint arXiv:2510.20956},
year = {2026}
}
备注
Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026