异构计算:驱动 AI 代理推理未来的关键
人工智能
2026-01-30 v1 硬件体系结构
分布式、并行与集群计算
摘要
AI 代理推理正在驱动推理密集型数据中心的未来,并暴露出计算瓶颈之外的限制,尤其是内存容量、内存带宽和高速互连。我们引入两种指标——操作强度(Operational Intensity, OI)和容量占用(Capacity Footprint, CF)——联合解释经典屋顶分析所遗漏的各种运行 regime,包括内存容量墙。对于不同的代理工作流程(聊天、编码、网页使用、计算机使用)和基础模型选择(GQA/MLA、MoE、量化),OI/CF 可发生剧变,长上下文 KV 缓存使得解码过程高度受内存限制。这些观察结果动机了异构化服务和系统级异构化:专用预填充和解码加速器、更广泛的规模化网络,以及由光学 I/O 实现的解耦计算-内存。我们进一步假设代理-硬件协同设计、系统内多个推理加速器,以及高带宽、大容量内存异构化作为适应不断变化的 OI/CF 的基础。综上,这些方向为大规模代理 AI 推理的效率与能力持续发展指明了道路。
引用
@article{arxiv.2601.22001,
title = {Heterogeneous Computing: The Key to Powering the Future of AI Agent Inference},
author = {Yiren Zhao and Junyi Liu},
journal= {arXiv preprint arXiv:2601.22001},
year = {2026}
}