ReasoningGuard:基于推理时安全顿悟时刻保护大型推理模型
计算与语言
2026-05-07 v2 人工智能
摘要
大型推理模型(LRM)在推理密集型任务中展现出惊人的性能,但它们仍然容易在推理过程的中后期生成有害内容。当前的防御方法依赖于高昂的微调和额外的专家知识,限制了其可扩展性。在本工作中,我们提出了 ReasoningGuard,一种用于 LRM 的推理时防御机制。它在推理过程中注入及时的安全顿悟时刻,以引导模型走向无害且有帮助的推理。我们的方法利用 LRM 的内部注意力机制准确识别推理路径中的关键点,触发安全性反思。为保护后续推理步骤和最终答案,我们在解码期间实现了比例抽样策略,以选择最佳推理路径。在最小的额外推理成本下,ReasoningGuard 有效缓解了四类越狱攻击,包括最近针对 LRM 推理过程的攻击。我们的方法在对抗九种现有防御措施的测试中表现出色,提供了最先进的防御,同时避免了常见的夸大报告问题。
引用
@article{arxiv.2508.04204,
title = {ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments},
author = {Yuquan Wang and Mi Zhang and Yining Wang and Geng Hong and Mi Wen and Xiaoyu You and Min Yang},
journal= {arXiv preprint arXiv:2508.04204},
year = {2026}
}