EffiBench:自动生成代码的效率基准测试
软件工程
2025-05-13 v6 计算与语言
摘要
代码生成模型已日益成为辅助软件开发不可或缺的一部分。尽管当前研究已彻底检验了代码生成模型所生成代码的正确性,但一个在绿色计算和可持续性努力中起关键作用的重要方面却常被忽视。本文提出了 EffiBench,一个包含 1,000 个效率关键型编码问题的基准,用于评估代码生成模型生成代码的效率。EffiBench 包含多样化的 LeetCode 编码问题。每个问题都配有一个可执行的人工编写的规范解决方案,该方案在 LeetCode 解决方案排行榜上获得了 SOTA 效率。借助 EffiBench,我们实证检验了 42 个大型语言模型(35 个开源和 7 个闭源)生成高效代码的能力。我们的评估结果表明,LLM 生成代码的效率通常劣于人工编写的规范解决方案。例如,GPT-4 生成代码的平均执行时间是人工编写规范解决方案的 \textbf{3.12} 倍。在最极端的情况下,GPT-4 生成代码的执行时间和总内存使用量分别是规范解决方案的 \textbf{13.89} 倍和 \textbf{43.92} 倍。EffiBench 的源代码发布在 https://github.com/huangd1999/EffiBench。我们还在 https://huggingface.co/spaces/EffiBench/effibench-leaderboard 提供了排行榜。
引用
@article{arxiv.2402.02037,
title = {EffiBench: Benchmarking the Efficiency of Automatically Generated Code},
author = {Dong Huang and Yuhao Qing and Weiyi Shang and Heming Cui and Jie M. Zhang},
journal= {arXiv preprint arXiv:2402.02037},
year = {2025}
}
备注
Camera Ready for NeurIPS 2024