中文

QEIL v2:基于Roofline模型导出的Pareto最优能耗建模与多目标调度的异构边缘智能

分布式、并行与集群计算 2026-04-07 v3

摘要

在异构边缘设备上部署大型语言模型(LLM)需要能够同时优化能源效率、推理质量和可靠性的框架。我们之前的QEIL v1(Kumar & Jha, 2026)实现了4.82倍的IPW提升,但依赖静态效率因子、贪心优化和未经验证的候选选择。QEIL v2用物理建模的、运行自适应模型取代了所有静态启发式方法。我们引入三项设备-工作负载指标:DASI(基于Roofline模型导出的计算利用率)、CPQ(基于分配理论的内存压力)和Phi(基于CMOS泄漏物理的热效益),构建统一能源方程,每个系数都可追溯至半导体物理。对于优化,我们提出PGSAM(Pareto引导的带动量模拟退火),同时最小化能源、延迟和设备利用率。推理阶段,EAC/ARDE选择级联搭配CSVET早停提供在重复样本间的渐进式验证。在WikiText-103、GSM8K和ARC-Challenge上评估,覆盖七类模型族(参数规模125M至8B,包括一个预量化变体),QEIL v2实现了63.8W时的75.7% pass@k(IPW=0.9749),较标准推理提升2.86倍。当应用于4-bit Llama-3.1-8B时,QEIL v2的物理建模路由实现IPW=1.024、54.8W——首个在边缘调度系统中超越IPW=1.0的经验参考标点的系统,其提升完全归因于QEIL v2在降低内存带宽需求的模型上实现的工作负载自适应设备分配。总能耗较标准方法下降75.6%,延迟降低38.3%,零热阈限,所有基准和模型族中实现100%故障恢复。

关键词

引用

@article{arxiv.2602.06057,
  title  = {QEIL v2: Heterogeneous Computing for Edge Intelligence via Roofline-Derived Pareto-Optimal Energy Modeling and Multi-Objective Orchestration},
  author = {Satyam Kumar and Saurabh Jha},
  journal= {arXiv preprint arXiv:2602.06057},
  year   = {2026}
}