ReasoningShield:面向大规模推理模型推理痕迹的安全检测
计算与语言
2025-10-16 v2 人工智能
摘要
大规模推理模型(LRMs)利用透明的推理痕迹(即链式思维,Chain-of-Thoughts, CoTs),将复杂问题分解为中间步骤并推导最终答案。然而,这些推理痕迹引入了独特的安全挑战:即使最终答案看似良性,损害内容也可能嵌入中间步骤。现有 moderation 工具设计用于处理生成的答案,难以有效检测 CoTs 中的隐藏风险。为此,我们引入 ReasoningShield,一个轻量且稳健的框架,用于 LRMs 中的 CoT moderation。我们的主要贡献包括:(1) 建立 CoT moderation 任务的多层次分类学,包含 10 种风险类别分布在 3 个安全层级;(2) 创建首个 CoT moderation 基准数据集,包含 9.2K 对查询与推理痕迹,包括 7K 样本的训练集通过人类-AI 框架标注,以及 2.2K 样本严格筛选的人类标注测试集;(3) 开发两种训练策略,结合逐步风险分析和对比学习以提升鲁棒性。实验表明,ReasoningShield 实现了最先进的性能,在基准测试中分别比面向特定任务的工具如 LlamaGuard-4 高出 35.6%,比通用商业模型如 GPT-4o 高出 15.8%,同时在多样化的推理范式、任务和未见情景中均表现出良好的泛化能力。所有资源已发布于 https://github.com/CosmosYi/ReasoningShield。
引用
@article{arxiv.2505.17244,
title = {ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models},
author = {Changyi Li and Jiayi Wang and Xudong Pan and Geng Hong and Min Yang},
journal= {arXiv preprint arXiv:2505.17244},
year = {2025}
}