中文

CodeJudge-Eval:大语言模型能否成为优秀的代码理解评判者?

软件工程 2024-09-16 v2 计算与语言

摘要

近期大语言模型(LLM)的进展展示了令人印象深刻的代码生成能力,主要通过语言到代码的基准测试进行评估。然而,这些基准测试可能无法充分捕捉模型的代码理解能力。我们引入CodeJudge-Eval(CJ-Eval),一个旨在从代码评判而非代码生成的角度评估LLM代码理解能力的新基准。CJ-Eval要求模型判断所提供代码解决方案的正确性,涵盖多种错误类型和编译问题。通过利用多样化的问题集和细粒度的评判系统,CJ-Eval解决了传统基准测试的局限性,包括解决方案可能被记忆的风险。对12个知名LLM在CJ-Eval上的评估表明,即使是最先进的模型也表现不佳,凸显了该基准测试在深入探测模型代码理解能力方面的价值。我们的代码和基准测试可在\url{https://github.com/CodeLLM-Research/CodeJudge-Eval}获取。

关键词

引用

@article{arxiv.2408.10718,
  title  = {CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?},
  author = {Yuwei Zhao and Ziyang Luo and Yuchen Tian and Hongzhan Lin and Weixiang Yan and Annan Li and Jing Ma},
  journal= {arXiv preprint arXiv:2408.10718},
  year   = {2024}
}

备注

The first two authors contributed equally