LLM推理揭秘:综述与Roofline模型洞见
计算与语言
2024-05-03 v6 人工智能
摘要
高效大型语言模型(LLM)推理领域正在快速发展,呈现出机遇与挑战并存的独特局面。尽管该领域已经扩展且充满活力,但尚未有一个简洁的框架来分析LLM推理的各种方法,以提供对该领域的清晰理解。我们的综述不同于传统的文献综述,不仅总结了当前的研究现状,还引入了一个基于roofline模型的框架,用于系统分析LLM推理技术。该框架识别了在硬件设备上部署LLM时的瓶颈,并提供了对实际问题的清晰理解,例如为什么LLM受内存限制、它们需要多少内存和计算量,以及如何选择合适的硬件。我们系统地整理了高效LLM推理的最新进展,涵盖了模型压缩(例如知识蒸馏和量化)、算法改进(例如早期退出和混合专家)以及硬件和系统级增强等关键领域。我们的综述通过使用roofline模型分析这些方法而脱颖而出,帮助我们理解它们对内存访问和计算的影响。这种独特的方法不仅展示了当前的研究格局,还为实际实施提供了宝贵的见解,使我们的工作成为该领域新手以及寻求加深对高效LLM部署理解的研究人员不可或缺的资源。分析工具LLM-Viewer已开源。
引用
@article{arxiv.2402.16363,
title = {LLM Inference Unveiled: Survey and Roofline Model Insights},
author = {Zhihang Yuan and Yuzhang Shang and Yang Zhou and Zhen Dong and Zhe Zhou and Chenhao Xue and Bingzhe Wu and Zhikai Li and Qingyi Gu and Yong Jae Lee and Yan Yan and Beidi Chen and Guangyu Sun and Kurt Keutzer},
journal= {arXiv preprint arXiv:2402.16363},
year = {2024}
}