流行单板计算机上 LLM 推理的评估
分布式、并行与集群计算
2025-11-12 v1 人工智能
摘要
对设备端大型语言模型(LLM)推理日益增长的需求正在推动在边缘硬件上部署轻便、成本效益高的 AI 解决方案的兴趣。单板计算机(SBCs)如树莓派和橙派提供了一个可实施的本地化、隐私保护推理平台——但在 LLM 工作负载的背景下仍鲜有被探索。本文在三台 SBC 上对 25 个量化开源 LLM 进行基准测试:树莓派 4、树莓派 5 和橙派 5 Pro,分别使用 Ollama 和 Llamafile 两种推理运行时。我们评估了在不同 CPU 配置下生成吞吐量、内存使用情况和功耗,同时使用多种提示类型模拟真实工作负载。我们的结果表明,SBCs 可可靠地支持最高达 15 亿参数的模型,Llamafile 在吞吐量上比 Ollama 高出最高 4 倍,功耗降低 30-40%。我们识别出特定架构的瓶颈,概述了运行时层面的权衡,并提供了实际的部署建议。这项研究为 LLM 推理在 SBCs 上的广泛评估提供了首次涵盖,弥合了高性能语言模型与 affordable edge computing 之间的鸿沟。
引用
@article{arxiv.2511.07425,
title = {An Evaluation of LLMs Inference on Popular Single-board Computers},
author = {Tung and Nguyen and Tuyen Nguyen},
journal= {arXiv preprint arXiv:2511.07425},
year = {2025}
}
备注
9 pages, 3 figures