中文

超越安全回答:评估大型推理模型真实风险意识的基准

人工智能 2025-05-27 v1

摘要

尽管大型推理模型(LRM)在处理复杂推理任务方面表现出卓越的能力,但其在安全关键场景中的可靠性仍不确定。现有的评估主要评估回答层面的安全性,忽略了一个我们将其界定为“表层安全对齐”(SSA)的关键问题——这是一种模型产生表面上安全的输出,而其内部推理过程却未能真正检测和缓解潜在风险的现象,导致在多次采样尝试中表现出不一致的安全行为。为了系统地调查 SSA,我们引入了“超越安全回答”(BSA)基准,这是一个新颖的基准,包含 2,000 个具有挑战性的实例,组织为三种不同的 SSA 场景类型,涵盖九个风险类别,每个实例都经过风险依据的细致标注。对 19 个最先进的 LRM 的评估证明了该基准的难度,表现最佳的模型在正确识别风险依据方面仅达到 38.0% 的准确率。我们进一步探索了安全规则、基于安全推理数据的专用微调以及多种解码策略在缓解 SSA 方面的有效性。我们的工作为评估和提升 LRM 的安全推理保真度提供了全面的评估工具,推动了具备真正风险意识和可靠安全性的 AI 系统的发展。

关键词

引用

@article{arxiv.2505.19690,
  title  = {Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models},
  author = {Baihui Zheng and Boren Zheng and Kerui Cao and Yingshui Tan and Zhendong Liu and Weixun Wang and Jiaheng Liu and Jian Yang and Wenbo Su and Xiaoyong Zhu and Bo Zheng and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2505.19690},
  year   = {2025}
}