中文

面向设备端大语言模型的硬件协同设计标度定律

机器学习 2026-02-12 v1 计算与语言

摘要

视觉-语言-动作模型(VLA)已成为物理 AI 的关键范式,正在在自动驾驶车辆、机器人和智能空间中部署。在这些资源受限的设备端场景中,合适选择大语言模型(LLM)主干架构是一个关键挑战:模型必须在准确率与严格的推理延迟和硬件效率约束之间进行平衡。这使得硬件软件协同设计成为设备端 LLM 部署的颠覆性要求,每个硬件平台都需要量身定制的架构解决方案。我们提出了一种硬件协同设计标度定律,联合捕捉模型准确率与推理性能。具体而言,我们将训练损失建模为架构超参数的显式函数,并通过屋顶模型(roofline modelling)来表征推理延迟。我们在 NVIDIA Jetson Orin 上经验性地评估了 1,942 个候选架构,对 170 个精选模型各训练 100 亿 token 以拟合架构与训练损失之间的标度关系。通过将该标度关系与延迟建模耦合,我们建立了准确率与延迟的直接对应关系,并确定了硬件协同设计 LLM 的帕累托前沿。我们进一步将架构搜索形式化为精度与性能的联合优化,推导出在工业硬件和应用预算约束下的可行设计区域。我们的 метод reduces 架构选择时间从数月缩短至数天。在与 Qwen2.5-0.5B 相同延迟下,我们的协同设计架构在 WikiText-2 上的 perplexity 降低 19.42%。据我们所知,这是首个针对设备端 LLM 部署的硬件协同设计标度定律的原则化且可操作的框架。我们将公开代码及相关模型 checkpoint。

关键词

引用

@article{arxiv.2602.10377,
  title  = {Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs},
  author = {Luoyang Sun and Jiwen Jiang and Yifeng Ding and Fengfa Li and Yan Song and Haifeng Zhang and Jian Ying and Lei Ren and Kun Zhan and Wei Chen and Yan Xie and Cheng Deng},
  journal= {arXiv preprint arXiv:2602.10377},
  year   = {2026}
}