理解LLM:从训练到推理的全面概述
计算与语言
2024-01-09 v2
摘要
ChatGPT的引入导致了大语言模型(LLM)在解决下游任务中的使用显著增加。在此背景下,人们越来越关注成本高效的训练和部署。低成本训练和部署LLM代表了未来的发展趋势。本文回顾了与这一新兴趋势相一致的大语言模型训练技术和推理部署技术的演变。关于训练的讨论包括多个方面,包括数据预处理、训练架构、预训练任务、并行训练以及与模型微调相关的内容。在推理方面,本文涵盖了模型压缩、并行计算、内存调度和结构优化等主题。它还探讨了LLM的使用,并对其未来发展提供了见解。
引用
@article{arxiv.2401.02038,
title = {Understanding LLMs: A Comprehensive Overview from Training to Inference},
author = {Yiheng Liu and Hao He and Tianle Han and Xu Zhang and Mengyuan Liu and Jiaming Tian and Yutong Zhang and Jiaqi Wang and Xiaohui Gao and Tianyang Zhong and Yi Pan and Shaochen Xu and Zihao Wu and Zhengliang Liu and Xin Zhang and Shu Zhang and Xintao Hu and Tuo Zhang and Ning Qiang and Tianming Liu and Bao Ge},
journal= {arXiv preprint arXiv:2401.02038},
year = {2024}
}
备注
30 pages,6 figures