中文

在 Apple Silicon 上大规模进行原生 LLM 与 MLLM 推理

机器学习 2026-01-30 v2 分布式、并行与集群计算 新兴技术

摘要

Apple Silicon 在机器学习开发中的日益普及,催生了对利用其独特统一内存架构的高效推理解决方案的需求。然而,现有工具要么缺乏原生优化(如 PyTorch MPS),要么仅专注于文本模型,导致多模态工作负载得不到充分支持。我们提出了 vllm-mlx,一个基于 MLX 原生构建的、在 Apple Silicon 上进行高效 LLM 和 MLLM 推理的框架。对于文本模型,在从 Qwen3-0.6B 到 Nemotron-30B 的模型范围内,我们的吞吐量比 llama-cpp 高出 21% 到 87%,同时提供连续批处理,在 16 个并发请求下可实现高达 4.3 倍的聚合吞吐量。对于多模态模型,我们引入了基于内容的 prefix 缓存,通过内容哈希识别相同图像,无论输入格式如何,都能消除冗余的视觉编码。我们在 Apple M4 Max 上的评估显示,文本模型的吞吐量高达每秒 525 个 token,重复图像查询的速度提升了 28 倍,将多模态延迟从 21.7 秒降至 1 秒以下。包含多达 64 帧的视频分析实现了 24.7 倍的缓存加速。我们将实现开源发布,以支持在消费级 Apple 硬件上进行高效推理。

关键词

引用

@article{arxiv.2601.19139,
  title  = {Native LLM and MLLM Inference at Scale on Apple Silicon},
  author = {Wayner Barrios},
  journal= {arXiv preprint arXiv:2601.19139},
  year   = {2026}
}