M100:驱动通用 AI 计算的编排数据流架构
机器学习
2026-04-21 v1 硬件体系结构
摘要
随着基于深度学习的 AI 技术取得发展,通用-purpose AI 计算架构的需求持续增长。虽然 GPGPU-based 架构在处理多样化 AI 工作负载方面具有灵活性,但往往在效率和性价比方面不足。各种领域特定架构(DSA)在特定 AI 任务中表现出色,但难以扩展到更广泛的应用或适应快速变化的 AI 领域。M100 是李稳动公司的回应:一个面向自动驾驶(AD)、大型语言模型(LLM)以及智能人机交互等领域的高性能、高性价比 AI 推理架构,这些是当今最具竞争力汽车平台的关键领域。M100 采用数据流并行架构,编译器-架构协同设计不仅调度计算,更关键的是跨时间和空间的数据传输。利用数据流计算效率,我们的硬件软件协同设计在提升系统性能的同时降低硬件复杂度和成本。M100 大幅消除缓存:张量计算由编译器和运行时管理的数据流驱动,数据在计算单元和内/外芯片存储器之间流动,实现更高的效率和可扩展性。另一个关键原则是为调度、下发和执行选择合适的运算粒度,涵盖编译器、固件和硬件。认识到 AI 工作负载的共性,我们将张量确立为基本数据元素。M100 在包括 UniAD(用于 AD)和 LLaMA(用于 LLM)在内的多样化推理应用中展示了通用 AI 计算能力。基准测试表明,M100 在 AD 应用中优于 GPGPU 架构,实现更高资源利用率,代表了未来通用 AI 计算的有前景的方向。
关键词
引用
@article{arxiv.2604.17862,
title = {M100: An Orchestrated Dataflow Architecture Powering General AI Computing},
author = {Yan Xie and Changkui Mao and Changsong Wu and Chao Lu and Chao Suo and Cheng Qian and Chun Yang and Danyang Zhu and Hengchang Xiong and Hongzhan Lu and Hongzhen Liu and Jiafu Liu and Jie Chen and Jie Dai and Junfeng Tang and Kai Liu and Kun Li and Lipeng Ge and Meng Sun and Min Luo and Peng Chen and Peng Wang and Shaodong Yang and Shibin Tang and Shibo Chen and Weikang Zhang and Xiao Ling and Xiaobo Du and Xin Wu and Yang Liu and Yi Jiang and Yihua Jin and Yin Huang and Yuli Zhang and Zhen Yuan and Zhiyuan Man and Zhongxiao Yao},
journal= {arXiv preprint arXiv:2604.17862},
year = {2026}
}
备注
Accepted to appear at ISCA 2026 Industry Track. 12 pages, 16 figures