中文

Agent-X:面向设备端 AI 智能体的全流程加速

人工智能 2026-05-12 v1

摘要

基于 LLM 的智能体在各种任务上实现了最佳性能,但在边缘设备上会产生高的端到端延迟。我们引入 Agent-X,这是一个仅软件、保持准确性的框架,用于加速基于设备端智能体工作负载的 prefill 和 decode 阶段。Agent-X 的两个关键组件重写提示以利用针对智能体特定输入标记模式的前缀缓存,并启用无 LLM 的 speculative 解码,以实现最小开销的快速标记生成。在代表性的智能体工作负载上,Agent-X 在实际系统中实现了 1.61 倍的端到端加速,未损失任何准确性,并可无缝集成到现有的设备端 AI 智能体中。据我们所知, ours 是首个系统性地刻画并消除设备端智能体延迟瓶颈的框架。

关键词

引用

@article{arxiv.2605.10380,
  title  = {Agent-X: Full Pipeline Acceleration of On-device AI Agents},
  author = {Jinha Chung and Byeongjun Shin and Jiin Kim and Minsoo Rhu},
  journal= {arXiv preprint arXiv:2605.10380},
  year   = {2026}
}

备注

Accepted for publication at MobiSys-2026