中文

评估 LLM 生成代码的能效

软件工程 2025-05-28 v1 人工智能

摘要

随着大型语言模型 (LLM) 生成代码质量的提高,软件行业在自动代码生成中对它们的采用持续增长。研究人员主要关注提高生成代码的功能正确性,而通常忽略其能效和环境影响。本文研究了 20 个流行的 LLM 针对 878 个从 LeetCode 平台选取的、难度各异且算法类别多样的编程问题所生成代码的能效,并将它们与规范的人工编写解决方案进行了比较。尽管 LLM 在大多数情况下能产生功能正确的结果,但我们的研究结果表明,LLM 生成的解决方案在性能和能效上通常远低于人工编写的解决方案。在所研究的 LLM 中,DeepSeek-v3 和 GPT-4o 生成的代码能效最高,而 Grok-2 和 Gemini-1.5-Pro 属于能效最低的模型。平均而言,人工生成的规范解决方案的能效约为 DeepSeek-v3 的 1.17 倍、GPT-4o 的 1.21 倍,以及 Grok-2 和 Gemini-1.5-Pro 的 2 倍以上。对于动态规划、回溯和位操作等特定算法类别,LLM 生成的代码消耗的能源可能高达人工生成的规范解决方案的 450 倍。

关键词

引用

@article{arxiv.2505.20324,
  title  = {Evaluating the Energy-Efficiency of the Code Generated by LLMs},
  author = {Md Arman Islam and Devi Varaprasad Jonnala and Ritika Rekhi and Pratik Pokharel and Siddharth Cilamkoti and Asif Imran and Tevfik Kosar and Bekir Turkkan},
  journal= {arXiv preprint arXiv:2505.20324},
  year   = {2025}
}