面向大型生成式模型的设备端 GPU 推理规模化
机器学习
2025-05-02 v1 人工智能
摘要
在生成式人工智能进步的推动下,大型机器学习模型已彻底改变了图像处理、音频合成和语音识别等领域。虽然基于服务器的部署仍然是性能巅峰所在,但出于隐私和效率的考量,设备端推理的必要性依然存在。认识到 GPU 是覆盖范围最广的设备端机器学习加速器,我们提出了 ML Drift——一个优化的框架,它扩展了最先进的 GPU 加速推理引擎的能力。ML Drift 使得能够在设备端执行生成式 AI 工作负载,这些工作负载包含的参数数量是现有设备端生成式 AI 模型的 10 到 100 倍。ML Drift 解决了与跨 GPU API 开发相关的复杂工程挑战,并确保了跨移动和桌面/笔记本电脑平台的广泛兼容性,从而促进了在资源受限设备上部署显著更复杂的模型。我们的 GPU 加速 ML/AI 推理引擎相比现有的开源 GPU 推理引擎,实现了数量级的性能提升。
引用
@article{arxiv.2505.00232,
title = {Scaling On-Device GPU Inference for Large Generative Models},
author = {Jiuqiang Tang and Raman Sarokin and Ekaterina Ignasheva and Grant Jensen and Lin Chen and Juhyun Lee and Andrei Kulik and Matthias Grundmann},
journal= {arXiv preprint arXiv:2505.00232},
year = {2025}
}
备注
to be published in CVPR 2025 Workshop on Efficient and On-Device Generation (EDGE)