面向大语言模型推理效率的粗粒度到细粒度评估
计算与语言
2024-04-18 v1 人工智能
摘要
在现实世界中,大型语言模型(LLM)可作为助手帮助用户完成他们的工作,也支持开发高级应用程序的开发。对于LLM的广泛应用,推理效率是一个关键关注点,这在已有工作中受到广泛研究,提出了诸多优化算法和代码库来提高它。尽管如此,用户仍然发现与比较上述所有方法的有效性并理解其背后的机制具有挑战性。在本工作中,我们对各种代码库的推理性能进行详细的粗粒度到细粒度分析。为评估整体有效性,我们检查了两个实际应用中的四个使用场景。我们进一步提供了每个Transformer架构模块的理论和实证细粒度分析。我们的实验结果为研究人员评估代码库以改进推理策略提供了不可估价的综合结果。
引用
@article{arxiv.2404.11502,
title = {Towards Coarse-to-Fine Evaluation of Inference Efficiency for Large Language Models},
author = {Yushuo Chen and Tianyi Tang and Erge Xiang and Linjiang Li and Wayne Xin Zhao and Jing Wang and Yunpeng Chai and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2404.11502},
year = {2024}
}