中文

Agent.xpu:在异构 SoC 上调度智能体 LLM 工作负载的高效引擎

分布式、并行与集群计算 2026-01-07 v2 机器学习

摘要

个人 LLM 智能体日益融合前台响应式交互与后台主动监控,形成长期的、有状态的 LLM 流程,这些流程交替进行 prefill 和逐 token 解码。虽然现代异构 SoC 集成了 CPU、iGPU 和 NPU 以支持本地智能,但现有 LLM 引擎假设是静态的、单次推理,缺乏对流水线级并发、优先级和高效加速器协调的机制。因此,商品化 SoC 尚未适配个人智能体的动态、混合关键性执行模式。本文提出了 Agent..xpu——首个在商品化 SoC 上编排并发响应式与主动式 LLM 流的 LLM 引擎。通过大规模剖析,发现其独特的 SoC 特征包括算子-加速器亲和性、非对称 DDR 争用以及阶段发现的批处理行为,这些特征与云端服务假设有显著区别。Agent..xpu 引入了三项关键技术:捕获 NPU/iGPU 亲和性和弹性算子绑定的异构执行图(HEG);面向流的 NPU-iGPU 协调,具备阶段弹性,解耦 prefill 与 decode 以减少带宽争用并实现优先级控制;以及基于 slack-aware piggybacking 的细粒度抢占机制,确保响应式响应的同时不挥霍主动工作。针对真实的个人智能体工作负载,Agent..xpu 相较于工业 iGPU-only 服务引擎和采用最优张量分区的 NPU-iGPU 静态推理,主动吞吐提升 1.2-4.9 倍,响应式延迟至少降低 91%。Agent..xpu 还通过受控 iGPU 用法最小化能耗和图形干扰。

关键词

引用

@article{arxiv.2506.24045,
  title  = {Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC},
  author = {Xinming Wei and Jiahao Zhang and Haoran Li and Jiayu Chen and Haoning Guan and Rui Qu and Maoliang Li and Xiang Chen and Guojie Luo},
  journal= {arXiv preprint arXiv:2506.24045},
  year   = {2026}
}