中文

OTora:面向 LLM 智能体的推理级拒绝服务统一红队框架

机器学习 2026-05-12 v1

摘要

大型语言模型(LLM)日益被部署为执行工具增强型、多步骤任务的自主智能体,其中延迟是实际应用中的关键因素。然而,一个被忽视的威胁是推理级拒绝服务(R-DoS),攻击者通过膨胀智能体推理深度或工具使用配额来降低可用性,同时保持任务正确性。我们引入 OTora,这是一个统一的两阶段红队框架,用于实例化 R-DoS 攻击。阶段 I 通过插入感知评分和动态目标共演化来优化导致特定工具调用的对抗触发器,支持黑箱和白箱设置。阶段 II 通过 ICL 指导的遗传搜索生成智能体感知的推理有效载荷,以放大过度思考,同时保持正确的任务结果。在基于多个主干模型(如 LLaMA-70B 和 GPT-OSS-120B)构建的 WebShop、Email 和 OS 智能体上,OTora 实现了推理 token 增加最高达 10 倍,延迟减缓数十倍,同时保持接近基准的任务准确率。最后,我们讨论了检测和约束异常推理和延迟激增的缓解策略。代码地址:https://github.com/llm2409/OTora。

关键词

引用

@article{arxiv.2605.08876,
  title  = {OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents},
  author = {Xinyu Li and Ronghui Mu and Lin Li and Tianjin Huang and Gaojie Jin},
  journal= {arXiv preprint arXiv:2605.08876},
  year   = {2026}
}

备注

Accepted to ICML 2026