面向生产 LLM 推理系统的动态性:通过混合预填/解码/验证调度实现 SOTA 优化
人工智能
2024-12-30 v1 分布式、并行与集群计算
机器学习
摘要
满足生产级大型语言模型(LLM)推理系统日益增长的低延迟和成本效率要求,需要集成先进的优化技术。然而,LLM 的动态且不可预测的输入输出长度, compounded by 这些优化技术,加剧了工作负载波动的问题,使得在 AI 加速器(尤其是具有基于砖块编程模型的 DSA)上保持高效性变得困难。为此,我们提出了 XY-Serve,一个灵活、原生 Ascend 的端到端生产 LLM 推理系统。核心思想是一种抽象机制,通过将计算分解为统一、硬件友好、细粒度的 meta 原语来平滑工作负载波动。对于注意力机制,我们提出一种以建筑感知的砖块大小计算注意力基本模式(matmul-softmax-matmul)的 meta kernel。对于 GEMM,我们引入一种虚拟填充方案,以适应动态形状变化,同时使用多种固定砖块大小的高效 GEMM 原语。XY-Serve 与 vLLM 良性集成。实验结果表明,在 Ascend NPU 上,与当前公开的基线相比,端到端吞吐量提升最高可达 89%。此外,我们的方法在 GEMM(平均快 14.6%)和注意力(平均快 21.5%)方面均优于现有库。虽然该工作是 Ascend 原生的,但我们认为该方法也能很快地应用于 SIMT 架构。
关键词
引用
@article{arxiv.2412.18106,
title = {Tackling the Dynamicity in a Production LLM Serving System with SOTA Optimizations via Hybrid Prefill/Decode/Verify Scheduling on Efficient Meta-kernels},
author = {Mingcong Song and Xinru Tang and Fengfan Hou and Jing Li and Wei Wei and Yipeng Ma and Runqiu Xiao and Hongjie Si and Dingcheng Jiang and Shouyi Yin and Yang Hu and Guoping Long},
journal= {arXiv preprint arXiv:2412.18106},
year = {2024}
}