超越内容安全:大型语言模型推理漏洞的实时监控
人工智能
2026-05-07 v2 密码学与安全
摘要
大型语言模型越来越依赖显式的思维链推理来解决复杂任务,但推理过程本身的安全性仍然基本未被关注。现有工作主要关注内容安全(即检测有害、有偏见或事实错误的输出),而将底层推理链视为不透明的中间产物。我们认为,推理安全构成了与内容安全正交的一个基本安全维度:要求模型的推理轨迹在逻辑上一致、计算上高效,并抵抗对抗性操纵。在本文中,我们形式化了推理安全,并引入了一个包含九种不安全推理行为的系统分类法。然后我们进行了一项大规模流行度研究,对超过4000条推理链进行了标注,涵盖良性基准和四种最先进的推理攻击,从经验上证明了全部九种错误类型在实践中都会出现,并具有可机械解释的签名。为了缓解这些威胁,我们提出了推理安全监控器:一个外部的、零样本验证框架,与目标LLM并行运行。它通过嵌入分类法的提示实时检查每一步推理,并在检测到不安全行为时分发中断信号。广泛的评估表明,我们的监控器实现了高达87.11%的步骤级定位准确率,大幅超越了幻觉检测器和最佳过程奖励模型基线。关键的是,该监控器在正确推理路径上保持低误报率,以可忽略的延迟开销运行,并表现出对自适应对抗规避的鲁棒韧性。这些发现确立了推理安全监控作为大型推理模型安全部署的一个高度可行且必不可少的组成部分。
引用
@article{arxiv.2603.25412,
title = {Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models},
author = {Xunguang Wang and Yuguang Zhou and Qingyue Wang and Zongjie Li and Ruixuan Huang and Zhenlan Ji and Pingchuan Ma and Shuai Wang},
journal= {arXiv preprint arXiv:2603.25412},
year = {2026}
}