Apple Silicon 本地大型语言模型推理:MLX、MLC-LLM、Ollama、llama.cpp 与 PyTorch MPS 的比较研究
硬件体系结构
2025-11-11 v1 人工智能
摘要
我们对比评估了 Apple Silicon 上五种本地大型语言模型 (LLM) 推理框架:MLX、MLC-LLM、llama.cpp、Ollama 和 PyTorch MPS。在配备 M2 Ultra 处理器和 192 GB 统一内存的 Mac Studio 上进行实验。我们使用 Qwen-2.5 模型家族,并测试从几百到 10 万 token 的提示,测量时间到第一个 token (TTFT)、稳态吞吐量、延迟分位数、长上下文行为(键值和提示缓存)、量化支持、流式性能、批处理和并发行为以及部署复杂度。在我们的设置下,MLX 实现了最高的持续生成吞吐量,而 MLC-LLM 在中等提示大小下持续提供较低的 TTFT,并提供更强的开箱即用推理功能。llama.cpp 在轻量级单流使用中非常高效,Ollama 强调开发者的 ergonomics 但在吞吐量和 TTFT方面落后于其他选项,而 PyTorch MPS 在大型模型和长上下文方面受限于内存限制。所有框架都在设备内完全执行,无遥测,确保强大的隐私保障。我们发布了脚本、日志和图表,以复现所有结果。我们的分析阐明了以 Apple 为中心的 LLM 部署中的设计权衡,为交互式和长上下文处理提供基于证据的建议。虽然 Apple Silicon 推理框架仍在绝对性能上落后于如 vLLM 等基于 NVIDIA GPU 的系统,但正在快速成熟为私有、设备本地的 LLM 推理提供生产级解决方案。
引用
@article{arxiv.2511.05502,
title = {Production-Grade Local LLM Inference on Apple Silicon: A Comparative Study of MLX, MLC-LLM, Ollama, llama.cpp, and PyTorch MPS},
author = {Varun Rajesh and Om Jodhpurkar and Pooja Anbuselvan and Mantinder Singh and Ashok Jallepali and Shantanu Godbole and Pradeep Kumar Sharma and Hritvik Shrivastava},
journal= {arXiv preprint arXiv:2511.05502},
year = {2025}
}