小型语言模型在边缘设备上的能耗特征与效率评估
分布式、并行与集群计算
2025-11-18 v1 人工智能
计算与语言
机器学习
摘要
云端大型语言模型(LLM)及其变体对实际应用产生了重大影响。将较小的模型(即小型语言模型,SLMs)部署在边缘设备上可提供额外优势,如降低延迟和独立于网络连接。然而,边缘设备的计算资源有限且能源预算受限,挑战在于高效部署。本研究评估了五个代表性小型语言模型——Llama 3.2、Phi-3 Mini、TinyLlama 和 Gemma 2 在树莓派 5、Jetson Nano 和 Jetson Orin Nano(CPU 和 GPU 配置)上的能源效率。结果表明,Jetson Orin Nano 配合 GPU 加速的能耗-性能比最高,显著优于基于 CPU 的配置。Llama 3.2 在准确率和能源效率之间提供了最佳平衡,TinyLlama 则适用于低功耗环境,但以牺牲准确率为代价。相比之下,Phi-3 Mini 虽然准确率高,但能耗最高。此外,GPU 加速、内存带宽和模型架构是优化推理能源效率的关键因素。我们的实证分析为人工智能、智能系统和移动 ad-hoc 平台提供了实用见解,帮助其在能源受限的环境中在准确率、推理延迟和能源效率之间进行权衡。
引用
@article{arxiv.2511.11624,
title = {Characterizing and Understanding Energy Footprint and Efficiency of Small Language Model on Edges},
author = {Md Romyull Islam and Bobin Deng and Nobel Dhar and Tu N. Nguyen and Selena He and Yong Shi and Kun Suo},
journal= {arXiv preprint arXiv:2511.11624},
year = {2025}
}
备注
Submitted version; 9 pages, 5 figures; presented at IEEE MASS 2025 (online publication pending)