中文

通过纠正性干预实现大型推理模型的安全推理

人工智能 2026-03-03 v2 计算与语言

摘要

尽管大型推理模型(LRMs)在解决复杂问题方面取得了进展,但它们的思维链(CoT)推理往往包含有害内容,即使最终回复看似安全,这些内容仍可能持续存在。我们证明这一问题在现有方法中仍然存在,这些方法忽视了安全推理的独特意义,削弱了其可信度,并在应用中构成了潜在风险,如果危险推理可被恶意用户获取和利用。因此,我们将重点转向推理本身的安全性,并探索过程监督作为解决方案。然而,由于 rollout 多样性低和训练信号有限,单纯奖励安全推理被证明是不充分的。为了应对这一挑战,我们首先深入分析安全推理的特征,并揭示了若干关键洞察:1)安全推理通常由少数关键的安全触发步骤巩固;2)合规提示与不安全延续之间存在强相关性;3)纠正性干预能够可靠地将不安全轨迹引导至更安全的轨迹。基于这些,我们提出了干预偏好优化(IPO),一种通过对齐方法,用安全触发步骤替换合规步骤,并通过构建具有强信号的偏好学习对来强制安全推理。在越狱和对抗性安全基准上的实验表明,IPO 显著提升了推理和回复的整体安全性,相比基于 SFT 和 RL 的基线方法,有害性相对降低了超过 30%,同时在多样化的推理任务上保持了出色的性能。结果强调了显式对齐推理的重要性,并为更安全的 LRMs 提供了实际路径。

关键词

引用

@article{arxiv.2509.24393,
  title  = {Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention},
  author = {Yichi Zhang and Yue Ding and Jingwen Yang and Tianwei Luo and Dongbai Li and Ranjie Duan and Qiang Liu and Hang Su and Yinpeng Dong and Jun Zhu},
  journal= {arXiv preprint arXiv:2509.24393},
  year   = {2026}
}

备注

ICLR 2026