SafeRBench:剖析大语言模型推理安全性
人工智能
2026-01-27 v3
摘要
大型推理模型(LRMs)通过显式的链式思考(Chain-of-Thought, CoT)推理显著提升了问题解决能力。然而,这一能力创造了安全-有帮助性悖论:推理过程本身可被滥用,以冗长的中间步骤为有害行为辩护或掩饰恶意意图。大多数现有基准仅检查最终输出,忽略了模型内部推理过程中风险是如何演变的,即“漂移”。为此,我们提出 SafeRBench,第一个从初始输入到推理轨迹再到最终答案全程评估 LRM 安全性的框架。我们的方法引入了:(i)风险分层探针,使用特定风险水平对安全边界进行压力测试,超越简单话题;(ii)微观思考分析,一种新的分块方法,用于精确定位安全对齐失效的具体位置;(iii)一套全面的 10 项细粒度指标,首次联合衡量模型的风险暴露(如风险水平、执行可行性)和安全意识(如意图意识)。在 19 个 LRM 的实验中揭示,尽管启用思考模式在中等规模模型中提升了安全性,但在大型模型中却因强烈的始终有帮助倾向而显著增加可操作风险。
关键词
引用
@article{arxiv.2511.15169,
title = {SafeRBench: Dissecting the Reasoning Safety of Large Language Models},
author = {Xin Gao and Shaohan Yu and Zerui Chen and Yueming Lyu and Weichen Yu and Guanghao Li and Jiyao Liu and Jianxiong Gao and Jian Liang and Ziwei Liu and Chenyang Si},
journal= {arXiv preprint arXiv:2511.15169},
year = {2026}
}
备注
29 pages, 8 figures