ReasoningBomb:诱导大规模推理模型产生异常长推理路径的隐蔽拒绝服务攻击
摘要
大规模推理模型(Large Reasoning Models, LRMs)扩展了大型语言模型,具备显式的多步骤推理痕迹,但这一能力引入了一类基于推理成本高的提示诱导的推理时间拒绝服务(Prompt-induced Inference-time Denial-of-Service, PI-DoS)攻击。我们首先形式化 LRMs 的推理成本,并定义 PI-DoS,然后证明任何实际的 PI-DoS 攻击都应满足三个属性:(1)高放大比率,即每个查询会导致其自身长度的比例不成比例的长推理痕迹;(2)隐蔽性,即提示和响应保持在自然语言流形上,规避分布偏移检测器;(3)可优化性,即该攻击支持高效优化,且不因其自身成功而受到阻碍。在此框架下,我们提出 ReasoningBomb,一种基于强化学习的 PI-DoS 框架,通过常数时间的代理奖励引导,训练大规模推理模型攻击者生成短自然提示,使受害者 LRMs 陷入异常长且常常实际上不终止的推理。我们在包括 LLMs 和 LRMs 在内的七个开源模型以及三个商业 LRM 上进行测试,ReasoningBomb 在推理模型上平均诱导 18,759 个完成标记,19,263 个推理标记。它在完成标记上比第二名基线高出 35%,在推理标记上高出 38%,同时诱导的标记数是良性查询的 6-7 倍,实现了 286.7 倍的输入到输出放大比率(在所有样本上平均)。此外,我们的方法在输入基于检测中实现 99.8% 的绕过率,在输出基于检测中实现 98.7% 的绕过率,针对严格的双阶段联合检测实现 98.4% 的绕过率。
引用
@article{arxiv.2602.00154,
title = {ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models},
author = {Xiaogeng Liu and Xinyan Wang and Yechao Zhang and Sanjay Kariyappa and Chong Xiang and Muhao Chen and G. Edward Suh and Chaowei Xiao},
journal= {arXiv preprint arXiv:2602.00154},
year = {2026}
}
备注
Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb