QUICK:面向高效LLM推理的量化感知交错与无冲突内核
机器学习
2024-02-16 v1 人工智能
计算与语言
摘要
我们介绍了QUICK,一组新颖的优化CUDA内核,用于高效推理量化的大型语言模型(LLM)。QUICK解决了现有最先进混合精度矩阵乘法内核的共享内存存储体冲突问题。我们的方法离线交错LLM的量化权重矩阵,以跳过反量化后的共享内存写回。我们在更大的批次上展示了相比AutoAWQ现有内核高达1.91倍的加速,以及在各种NVIDIA GPU设备上代表性LLM模型高达1.94倍的吞吐量提升。
引用
@article{arxiv.2402.10076,
title = {QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference},
author = {Taesu Kim and Jongho Lee and Daehyun Ahn and Sarang Kim and Jiwoong Choi and Minkyu Kim and Hyungjun Kim},
journal= {arXiv preprint arXiv:2402.10076},
year = {2024}
}
备注
9 pages, 8 figures