大型推理模型安全性提升:一项实证研究
计算与语言
2026-04-21 v2
摘要
大型推理模型(LRM)在数学和编程等推理密集型任务上取得显著成绩,但其增强的推理能力未必转化为改进的安全性能——在某些情况下甚至可能恶化。这引发了一个重要问题:我们应如何提升LRM的安全性?本文提出了一项针对LRM安全性通过监督式微调(SFT)的全面实证研究。我们的调查始于一个意外发现:直接从DeepSeek-R1蒸馏安全响应无法显著提升安全性。我们分析了这一现象,识别出五个关键风险模式对其贡献。随后,我们证明在数据蒸馏过程中显式解决这些问题可实现显著的安全性提升。接下来,我们探讨了长而复杂的推理过程是否是实现安全性所必需的。有趣的是,我们发现仅使用短或模板化的推理过程即可实现相当的安全性能。这促使我们深入反思推理在确保安全性中的作用。最后,我们进行了全面的消除实验以揭示不同训练配置的影响。总体而言,我们希望本实证研究能为提升LRM安全性提供更全面的图景。实验中使用的代码和数据已发布于https://github.com/thu-coai/LRM-Safety-Study。
引用
@article{arxiv.2505.15404,
title = {How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study},
author = {Zhexin Zhang and Xian Qi Loye and Victor Shea-Jay Huang and Junxiao Yang and Qi Zhu and Shiyao Cui and Fei Mi and Lifeng Shang and Yingkang Wang and Hongning Wang and Minlie Huang},
journal= {arXiv preprint arXiv:2505.15404},
year = {2026}
}
备注
ACL 2026 Main Conference