安全失败于答案之前:对推理链中有害行为的基准测试
计算与语言
2026-04-22 v1
摘要
大型推理模型(LLMs)产生复杂的多步骤推理痕迹,但安全评估仍集中在最终输出上,忽略了在推理过程中如何产生危害。当被越狱攻击时,危害并非瞬时出现,而是通过抑制拒绝、合理化遵从、分解有害任务和隐藏风险等 distinct 步骤逐步展开。然而,现有基准测试未在推理痕迹中捕获这种过程的句子级细粒度,这是通往可靠安全监控、干预和系统性失效诊断的关键一步。为填补这一差距,我们引入 HarmThoughts,一个用于评估推理痕迹中逐步安全性的基准测试。\ourdataset 基于我们提出的 16 类有害推理行为的分类法构建,涵盖四个功能组,刻画危害如何传播而非产生什么危害。数据集由 56,931 句话构成,来自 1,018 条由四类模型家族生成的推理痕迹,每句话均标注了细粒度的句子级行为标签。使用 HarmThoughts,我们分析了推理痕迹中的危害传播模式,识别出常见的行为轨迹以及推理从安全转向不安全的临界点。最后,我们系统比较了白盒和黑盒检测器在 HarmThoughts 上识别有害推理行为任务中的表现。结果显示,现有检测器在推理痕迹中进行细粒度行为检测方面困难,尤其是针对危害产生和执行中的细微类别,凸显了在过程级安全监控方面的关键缺口。HarmThoughts 已公开提供:https://huggingface.co/datasets/ishitakakkar-10/HarmThoughts
引用
@article{arxiv.2604.19001,
title = {When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains},
author = {Ishita Kakkar and Enze Zhang and Rheeya Uppaal and Junjie Hu},
journal= {arXiv preprint arXiv:2604.19001},
year = {2026}
}