中文

促进链路思维生成前的安全决策:面向更安全的大型推理模型

人工智能 2026-05-05 v2

摘要

大型推理模型(LRMs)通过链路思维(CoT)实现了显著的性能提升,但近期研究表明,这种增强的推理能力以显著损害安全能力为代价。本文揭示了LRMs的安全性能退化仅在启用CoT后发生,而在CoT未启用的情况下并未观察到这种退化。这一发现激励我们考虑在CoT生成之前鼓励LRMs进行安全决策。为此,我们提出了一种新颖的安全对齐方法,通过在CoT生成前促进LRMs的安全决策。具体而言,我们首先利用基于BERT的分类器从安全模型(如禁用CoT的LRM)中提取安全决策信号,然后将这些信号整合到LRMs的安全对齐中作为辅助监督。如此一来,安全梯度可反向传播到LRMs的潜在表示中,从而有效增强LRMs在CoT生成过程中的安全决策能力。大量实验表明,我们的方法在显著提升LRMs的安全能力方面取得显著效果,同时有效维持了LRMs的常规推理性能。

关键词

引用

@article{arxiv.2603.17368,
  title  = {Towards Safer Large Reasoning Models by Promoting Safety Decision-Making before Chain-of-Thought Generation},
  author = {Jianan Chen and Zhifang Zhang and Shuo He and Linan Yue and Lei Feng and Minling Zhang},
  journal= {arXiv preprint arXiv:2603.17368},
  year   = {2026}
}