中文

评估高效代码生成的语言模型

软件工程 2024-08-14 v1 计算与语言 机器学习

摘要

我们引入了差异性能评估(DPE)框架,用于可靠地评估大型语言模型(LLM)的高效代码生成。传统的编码基准通常无法提供关于代码效率的可靠见解,原因在于其依赖简单测试输入且缺乏有效的复合指标。DPE 通过关注高效需求的编程任务,并建立洞见的复合指标来解决这些问题。DPE 以两个阶段运行:首先,从现有编码基准中筛选高效需求的任务,并生成计算昂贵的输入以考验 LLM 解决方案的效率;其次,剖析新的解决方案并全局地将其与一组具有不同效率水平的参考解决方案进行比较,其中匹配的水平定义其效率得分。作为概念验证,我们使用 DPE 创建了包含 121 个性能挑战性编码任务的 EvalPerf 基准。我们的全面评估对模型大小、指令调优和提示词的效率影响得出了有趣的结论。例如,虽然规模定律未能解释代码效率,但通用指令调优同时惠及代码正确性和效率。我们还评估了评估本身的效果,表明 EvalPerf 可靠且便于使用,即使在不同平台上也是如此。

关键词

引用

@article{arxiv.2408.06450,
  title  = {Evaluating Language Models for Efficient Code Generation},
  author = {Jiawei Liu and Songrun Xie and Junhao Wang and Yuxiang Wei and Yifeng Ding and Lingming Zhang},
  journal= {arXiv preprint arXiv:2408.06450},
  year   = {2024}
}