UnsafeChain:通过困难案例增强推理模型的安全性
计算与语言
2026-03-31 v2
摘要
随着大型推理模型能力的增强,思维链推理引入了新的安全挑战。现有的基于SFT的安全对齐研究主要集中于用安全、高质量的响应过滤提示,而忽略了那些总是引发有害输出的困难提示。为填补这一空白,我们引入了UnsafeChain,一个由来自多种来源的困难提示构建的安全对齐数据集,其中不安全补全被识别并明确纠正为安全响应。通过向模型暴露不安全行为并引导其纠正,UnsafeChain在保持通用推理能力的同时增强了安全性。我们在UnsafeChain上微调了三个LRM,并将其与最近的SafeChain和STAR-1在六个分布外和五个分布内基准上进行了比较。UnsafeChain始终优于先前数据集,即使是1K子集也能达到或超过基线性能,证明了基于纠正的监督的有效性和泛化性。我们在https://github.com/mbzuai-nlp/UnsafeChain发布数据集和代码。
引用
@article{arxiv.2507.21652,
title = {UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases},
author = {Raj Vardhan Tomar and Preslav Nakov and Yuxia Wang},
journal= {arXiv preprint arXiv:2507.21652},
year = {2026}
}