基于语义触发器和心理学框架的大推理模型推理目标化越狱攻击
机器学习
2026-04-20 v1 人工智能
摘要
大推理模型 (LRMs) 在生成逐步推理链的同时展现出强大的能力,使其能够在医疗和教育等高风险领域部署。虽然先前的越狱攻击研究聚焦于最终答案的安全性,但针对推理过程的安全性几乎未受关注。本文识别出一种新问题,即在保持答案不变的前提下,将有害内容注入推理步骤。这种攻击方式提出两个关键挑战:1) 操作输入指令可能无意中改变 LRM 的最终答案;2) 输入问题的多样性使难以持续规避 LRM 的安全对齐机制并将有害内容嵌入其推理过程中。为此,我们提出了 Psychology-based Reasoning-targeted Jailbreak Attack (PRJA) 框架,该框架集成了语义触发器选择模块和心理学基于指令生成模块。具体而言,PRJA 通过语义分析自动选择具备操纵性的推理触发器,并利用顺从权威和道德不正当化的心理学理论生成以增强 LRM 服从有害内容生成指令的自适应指令。针对五个问答数据集进行大量实验,表明 PRJA 在包括 DeepSeek R1、Qwen2.5-Max 和 OpenAI o4-mini 在内的几款商业 LRMs 上实现约 83.6% 的平均攻击成功率。
引用
@article{arxiv.2604.15725,
title = {Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing},
author = {Zehao Wang and Lanjun Wang},
journal= {arXiv preprint arXiv:2604.15725},
year = {2026}
}