RealSafe-R1:在不妥协推理能力的前提下实现深度安全对齐
人工智能
2025-04-15 v1 计算与语言
摘要
大型推理模型(LRMs)如OpenAI o1和DeepSeek-R1正在迅速发展并在数学和编码等复杂推理任务中取得突破性性能。然而,开源R1模型在广泛应用中引发了安全问题,例如倾向于遵从恶意查询,这大大影响了这些强大模型在实际应用中的实用性。在本文中,我们引入RealSafe-R1作为DeepSeek-R1蒸馏模型的安全对齐版本。为训练这些模型,我们构建了一个包含15k个安全感知推理轨迹的数据集,这些轨迹是DeepSeek-R1在明确拒绝行为指令下生成的。定量实验和定性案例研究均显示,模型在针对有害查询和越狱攻击方面的安全防护得到了改进。重要的是,我们的方法通过保持训练数据在生成分布内,保留了模型的推理能力,与先前的安全对齐努力通常会牺牲推理性能不同。RealSafe-R1的模型权重已开源于 https://huggingface.co/RealSafe。
引用
@article{arxiv.2504.10081,
title = {RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability},
author = {Yichi Zhang and Zihao Zeng and Dongbai Li and Yao Huang and Zhijie Deng and Yinpeng Dong},
journal= {arXiv preprint arXiv:2504.10081},
year = {2025}
}