链式风险:大规模推理模型中的安全失效及基于自适应多原则引导的缓解方法
人工智能
2026-05-08 v1
摘要
大规模推理模型(LRM)日益暴露类似链式思维的推理过程,以实现透明性、验证和深入思考。这创造了一个安全盲区:即使最终答案看起来安全,推理痕迹中可能出现有害或违反政策的内容。我们测试最终答案安全性是否足以作为完整推理-答案轨迹的代理指标,通过在统一的二十原则安全评估标准下对两个阶段进行评分。使用来自七个公共有害性和越狱来源的提示,以及四个分布外(OOD)来源,我们评估了15个开源权重和基于API的LRM,每个模型4.1万个提示。推理痕迹始终揭示了超过最终答案的额外安全风险,尤其在高严重性阶段性失效中表现突出:漏洞案例中,unsafe的推理紧随一个看似安全的答案;逃脱案例中,看似良性的推理紧随一个不安全的最终响应。原则级别的分析显示,风险集中在误导信息、法律合规、歧视、身体伤害和心理伤害方面。我们进一步提出了自适应多原则引导方法,这是一种白盒测试时缓解措施,通过为每个安全原则学习一个unsafe到safe的激活方向,并仅激活当前隐藏状态距离unsafe质心而非safe质心更近的方向。在三个可引导的开源推理模型上,自适应引导在 held-out和OOD基准测试中显著减少了推理痕迹和最终答案中的unsafe计数。DeepSeek-R1-Qwen-7B在BBH、GSM8K和MMLU上实现了40.8%的平均unsafe计数减少,同时保持97.7%的宏平均准确率。这些结果表明,LRM的安全性应在完整暴露的推理-答案轨迹上进行评估和缓解,而不仅仅是在最终答案阶段。
引用
@article{arxiv.2605.05678,
title = {Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering},
author = {Xiaomin Li and Jianheng Hou and Zheyuan Deng and Zhiwei Zhang and Taoran Li and Binghang Lu and Bing Hu and Yunhan Zhao and Yuexing Hao},
journal= {arXiv preprint arXiv:2605.05678},
year = {2026}
}