从 LLM 到硅片:基于 RL 的 ASIC 架构探索用于设备端 AI 推理
硬件体系结构
2026-04-10 v1 机器学习
摘要
我们提出了一个基于强化学习(RL)的编译器,联合优化 ASIC 架构、内存层次结构和工作负载划分,用于 3nm 至 28nm 范围内的 AI 推理。该设计空间被形式化为一个具有混合离散-连续动作和统一功耗-性能-面积(PPA)目标的单一马尔可夫决策过程(MDP)。Soft Actor-Critic(SAC)配合 Mixture-of-Experts 门控机制探索网格拓扑、每个核心的微架构以及算子放置的联合空间。我们在两个工作负载上进行了验证:Llama 3.1 8B FP16(高性能模式,3nm 下达 29809 个 token/s)和 SmolVLM(低功耗模式,所有节点功耗低于 13 mW,频率为 10 MHz)。在 7 个工艺节点上,RL 自动适应网格大小和每个瓷片的配置,包括无需节点特定手动调参的异构 FETCH、VLEN 和内存分配。
引用
@article{arxiv.2604.07526,
title = {From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference},
author = {Ravindra Ganti and Steve Xu},
journal= {arXiv preprint arXiv:2604.07526},
year = {2026}
}
备注
25 pages, 12 figures, 21 tables