FP6-LLM:通过以FP6为中心的算法-系统协同设计高效服务大语言模型
机器学习
2024-03-05 v2 人工智能
硬件体系结构
摘要
六位量化(FP6)可以有效减小大语言模型(LLM)的规模,并在各种应用中一致地保持模型质量。然而,现有系统并未为FP6量化提供张量核心支持,难以在LLM推理过程中实现实际的性能提升。在GPU上支持FP6量化具有挑战性,原因在于:(1)位宽不规则的模型权重导致不友好的内存访问;(2)权重量化解量化带来的高运行时开销。为了解决这些问题,我们提出了TC-FPx,这是首个全栈GPU内核设计方案,为各种量化位宽的浮点权重提供统一的Tensor Core支持。我们将TC-FPx内核集成到现有的推理系统中,为量化LLM推理提供了新的端到端支持(称为FP6-LLM),从而在推理成本和模型质量之间实现了更好的权衡。实验表明,FP6-LLM仅使用单个GPU即可实现LLaMA-70b的推理,其归一化推理吞吐量比FP16基线高出1.69倍至2.65倍。源代码已公开发布在https://github.com/usyd-fsalab/fp6_llm。
引用
@article{arxiv.2401.14112,
title = {FP6-LLM: Efficiently Serving Large Language Models Through FP6-Centric Algorithm-System Co-Design},
author = {Haojun Xia and Zhen Zheng and Xiaoxia Wu and Shiyang Chen and Zhewei Yao and Stephen Youn and Arash Bakhtiari and Michael Wyatt and Donglin Zhuang and Zhongzhu Zhou and Olatunji Ruwase and Yuxiong He and Shuaiwen Leon Song},
journal= {arXiv preprint arXiv:2401.14112},
year = {2024}
}
备注
Adding URL link of the source code