中文

Apple M3 Ultra 上实时扩散模型推理的系统化优化

机器学习 2026-05-19 v1 人工智能 分布式、并行与集群计算

摘要

虽然使用扩散模型实现实时图像生成在NVIDIA GPU上取得了快速进展,但针对Apple Silicon等非CUDA平台的系统化优化研究仍极其有限。本研究在目标为Apple M3 Ultra(60核GPU,512GB统一内存)的10个阶段系统优化实验中,旨在实现实时相机 img2img 转换。我们探索了广泛的技术,包括CoreML转换、量化、Token 合并、Neural Engine利用、紧凑模型探索、帧插值、kNN 搜索式合成、pix2pix-turbo、光流帧跳过和知识蒸馏,定量评估了每种方法的有效性。最终,通过结合 distillation-specialized 模型 SDXS-512 的 CoreML 转换和3线程相机管线,我们实现了在512x512分辨率下达到22.7 FPS的实时相机 img2img 转换。本工作的主要贡献是系统性地展示了针对CUDA建立的优化见解在Apple Silicon统一内存架构上并不一定有效。我们揭示了与NVIDIA GPU fundamentally不同的优化landscape——包括量化缺乏加速、并行推理无效以及Neural Engine不适用于大规模模型——并为Apple Silicon上的扩散模型推理提供了实用指南。

关键词

引用

@article{arxiv.2605.16259,
  title  = {Systematic Optimization of Real-Time Diffusion Model Inference on Apple M3 Ultra},
  author = {Yoichi Ochiai},
  journal= {arXiv preprint arXiv:2605.16259},
  year   = {2026}
}