本地大语言模型的能源效率比例定律
人工智能
2025-12-30 v4
摘要
在边缘设备上部署本地大语言模型和视觉语言模型需要在准确率与受限计算和能源预算之间进行权衡。虽然图形处理器主导了现代人工智能部署,但大多数消费硬件——包括笔记本电脑、桌面计算机、工业控制器和嵌入式系统——依赖中央处理单元。尽管如此,关于仅使用中央处理单元进行本地语言和视觉语言工作负载推理的计算定律仍然鲜有探索。我们在两种代表性的中央处理单元档次上系统性地对大语言模型和视觉语言模型进行基准测试: MacBook Pro M2,反映主流笔记本级部署;以及树莓派 5,代表受限、低功耗的嵌入式设置。使用基于持续采样处理器和内存使用情况以及面积-under-curve 积分的统一方法,我们描述了计算负载如何随输入文本长度变化(针对语言模型)以及随图像分辨率变化(针对视觉语言模型)。我们发现两条经验性比例定律:(1)语言模型推理的计算成本大约随 token 长度线性增长;(2)视觉语言模型显示出一种预处理驱动的“分辨率肩部”,即在内部分辨率限制之上,计算量保持恒定,而在其以下则急剧下降。除这些定律之外,我们展示了量子启发的压缩可将处理器和内存使用降低最高 71.9%,能源消耗降低最高 62%,同时保持或提高语义准确性。这些结果为多模态中央处理单元唯一的本地语言和视觉语言工作负载提供了系统化的量化,并指出模型压缩和输入分辨率预处理是有效且低成本的可持续边缘推理杠杆。
引用
@article{arxiv.2512.16531,
title = {Scaling Laws for Energy Efficiency of Local LLMs},
author = {Ander Alvarez and Alessandro Genuardi and Nilotpal Sinha and Antonio Tiene and Mikail Okyay and Bakbergen Ryskulov and David Montero and Samuel Mugel and Román Orús},
journal= {arXiv preprint arXiv:2512.16531},
year = {2025}
}