中文

面向可持续NLP:基于大语言模型推理能耗基准测试的洞见

计算与语言 2025-03-18 v2

摘要

大语言模型(LLM)因其卓越的生成能力和跨任务的通用性而日益受到重视。然而,与现有研究在训练成本上的关注相比,这些模型的高推理成本尚未得到充分关注。为弥合这一差距,我们的研究对LLM推理能耗进行全面基准测试,涵盖广泛的NLP任务,分析不同模型、任务、提示词以及系统相关因素对推理能耗的影响。具体而言,我们的实验揭示了若干有趣的见解,包括推理能耗与输出token长度和响应时间高度相关。我们还发现,量化技术、最优批量大小以及针对性提示词可显著降低能耗。本研究是首次对LLM推理在如此广泛的方面进行彻底基准测试,为改进模型部署中的能源效率提供了洞见和若干建议。

关键词

引用

@article{arxiv.2502.05610,
  title  = {Towards Sustainable NLP: Insights from Benchmarking Inference Energy in Large Language Models},
  author = {Soham Poddar and Paramita Koley and Janardan Misra and Sanjay Podder and Niloy Ganguly and Saptarshi Ghosh},
  journal= {arXiv preprint arXiv:2502.05610},
  year   = {2025}
}

备注

Accepted at the NAACL 2025 Main Conference