Apple M3 Ultra 上实时扩散模型推理的系统化优化
机器学习
2026-05-19 v1 人工智能
分布式、并行与集群计算
摘要
虽然使用扩散模型实现实时图像生成在NVIDIA GPU上取得了快速进展,但针对Apple Silicon等非CUDA平台的系统化优化研究仍极其有限。本研究在目标为Apple M3 Ultra(60核GPU,512GB统一内存)的10个阶段系统优化实验中,旨在实现实时相机 img2img 转换。我们探索了广泛的技术,包括CoreML转换、量化、Token 合并、Neural Engine利用、紧凑模型探索、帧插值、kNN 搜索式合成、pix2pix-turbo、光流帧跳过和知识蒸馏,定量评估了每种方法的有效性。最终,通过结合 distillation-specialized 模型 SDXS-512 的 CoreML 转换和3线程相机管线,我们实现了在512x512分辨率下达到22.7 FPS的实时相机 img2img 转换。本工作的主要贡献是系统性地展示了针对CUDA建立的优化见解在Apple Silicon统一内存架构上并不一定有效。我们揭示了与NVIDIA GPU fundamentally不同的优化landscape——包括量化缺乏加速、并行推理无效以及Neural Engine不适用于大规模模型——并为Apple Silicon上的扩散模型推理提供了实用指南。
引用
@article{arxiv.2605.16259,
title = {Systematic Optimization of Real-Time Diffusion Model Inference on Apple M3 Ultra},
author = {Yoichi Ochiai},
journal= {arXiv preprint arXiv:2605.16259},
year = {2026}
}