针对基于推理的安全警戒线的一系列技巧
密码学与安全
2025-10-24 v2 计算与语言
摘要
近期针对大型推理模型(LRM)的基于推理的安全警戒线,如审慎对齐,已显示出对抗越狱攻击的强大防御能力。通过利用LRM的推理能力,这些警戒线帮助模型在生成最终响应前评估用户输入的安全性。强大的推理能力能够分析输入查询的意图,一旦检测到隐藏于越狱方法中的有害意图,便会拒绝提供帮助。此类警戒线在防御方面显著提升,如在开源gpt-oss系列模型上几乎实现完美拒绝率。不幸的是,我们发现这些强大的推理-based警戒线对输入提示的细微操纵极其脆弱,一旦被劫持,可能导致更有害的结果。具体而言,我们首先发现这些警戒线的一个惊人脆弱方面:仅通过向输入提示添加少量模板标记,即可成功绕过看似强大的警戒线,导致显式且有害的响应。为进一步探索,我们引入一系列越狱方法来颠覆基于推理的警戒线。我们的攻击涵盖白箱、灰箱和黑箱设置,范围从轻松的模板操纵到完全自动化优化。尽管这些方法具有可扩展实现的潜力,还在gpt-oss系列模型(包括本地主机模型和在线API服务)上实现了令人警异的高攻击成功率(例如,在5个不同基准测试中超过90%)。针对各种领先开源LRM的评估确认,这些漏洞是普遍存在的,凸显了为开源LRM防止恶意滥用而需要更强对齐技术的紧迫性。代码已开源于 https://chenxshuo.github.io/bag-of-tricks。
引用
@article{arxiv.2510.11570,
title = {Bag of Tricks for Subverting Reasoning-based Safety Guardrails},
author = {Shuo Chen and Zhen Han and Haokun Chen and Bailan He and Shengyun Si and Jingpei Wu and Philip Torr and Volker Tresp and Jindong Gu},
journal= {arXiv preprint arXiv:2510.11570},
year = {2025}
}
备注
OpenAI Red-teaming Challenge Winner and Oral Presentation