能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持过程级能源归因
机器学习
2026-05-28 v1 人工智能
硬件体系结构
分布式、并行与集群计算
性能
摘要
代理 AI 工作负载——单个用户目标触发多步骤编排、工具调用、重试与故障恢复——正被针对边缘部署,NVIDIA、Dell、HP、ASUS、MSI、Acer 与 Gigabyte 均将于 2026 年推出基于 GB10 的桌面 AI 系统。我们最近展示过,编排结构主导能源消耗,工作流程的能耗是线性基准的 4.33 倍,OOI 对多步骤推理任务可达 7.63 倍。此外,Rajat 等人指出,CPU 端处理在代理工作负载中占总时延最高达 90.6%,占总动态能耗 44%。我们对 ASUS Ascent GX10 (GB10 SoC) 进行系统能源可观测性审计,发现该平台未暴露 CPU 能源计数器、INA 电源轨监控器、IPMI/BMC 或 SCMI powercap 协议。唯一的设备能源遥测仅为 GPU 通过 NVML 的瞬时功率。我们进一步发现,MediaTek 固件已通过未公开的 ACPI 接口 (SPBM) 计算每个电轨的能耗,但 NVIDIA 表示“无计划暴露 CPU 轨信息”。因此,无法通过受支持的接口在该平台上实现设备级过程能源归因。我们提出硬件能源归因 AI 需求规范,提出一种采用外部直流计量结合 GPU 减法的 interim 校准桥接方案,并指明通过 SCMI powercap 的标准化路径。我们的发现激励低碳计算社区要求将能源可观测性作为一级硬件要求。
引用
@article{arxiv.2605.27599,
title = {The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution},
author = {Deepak Panigrahy and Aakash Tyagi},
journal= {arXiv preprint arXiv:2605.27599},
year = {2026}
}