中文

提升大型语言模型的推理效率:优化策略与架构创新探究

机器学习 2024-04-10 v1 人工智能 计算与语言 性能

摘要

大型语言模型的规模不断增长,且我们预计这一趋势将持续,因为更大的模型训练更快。然而,规模的增加将严重影响推理成本。因此,模型压缩非常重要,以在保持大模型性能的同时降低其运行成本。在本文中,我们探讨了模型压缩的方法,并经验证表明,在 Transformer LLM 中跳过后面的注意力子层这一简单方法是有效的模型压缩方法,因为这些层被证明是冗余的,同时计算成本又极其高昂。我们在 Llama 2 7B 的单 token 生成中观察到 21% 的速度提升,同时令人惊讶且出乎意料地在几个常见基准测试上提升了性能。

关键词

引用

@article{arxiv.2404.05741,
  title  = {Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations},
  author = {Georgy Tyukin},
  journal= {arXiv preprint arXiv:2404.05741},
  year   = {2024}
}