推理模型的安全恢复仅需少量早期引导步骤
计算与语言
2026-02-12 v1 人工智能
摘要
基于强化学习(RL)的后训练用于显式链式思考(如 GRPO)可提高多模态大型推理模型(MLRMs)的推理能力。但最近的证据表明,它可能同时损害安全对齐并增加越狱成功率。我们提出了 SafeThink,这是一种轻量级推理时防御措施,将安全恢复视为满足约束而非最大化目标。SafeThink 监控正在进行的推理痕迹,并在安全阈值被违反时条件性地注入优化后的短式纠正前缀(“Wait, think safely”)。在我们对六个开源 MLRMs 和四个越狱基准测试(JailbreakV-28K、Hades、FigStep 和 MM-SafetyBench)的评估中,SafeThink 将攻击成功率降低 30%~60%(例如 LlamaV-o1:JailbreakV-28K 上从 63.33%降至 5.74%,R1-Onevision:Hades 上从 69.07%降至 5.65%),同时保持推理性能(MathVista 正确率:65.20%至 65.00%)。我们实验的关键经验发现是,安全恢复通常只需少量引导步骤:在前 1~3 个推理步骤中干预,通常就足以将整个生成重定向到安全完成。
引用
@article{arxiv.2602.11096,
title = {Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away},
author = {Soumya Suvra Ghosal and Souradip Chakraborty and Vaibhav Singh and Furong Huang and Dinesh Manocha and Amrit Singh Bedi},
journal= {arXiv preprint arXiv:2602.11096},
year = {2026}
}