CodeMMLU:评估 CodeLLM 编程理解与推理能力的多任务基准
软件工程
2025-04-10 v4
摘要
近期 Code 大语言模型(CodeLLM)的进展主要聚焦于开放式代码生成,往往忽视了代码理解与推理这一关键方面。为弥合这一差距,我们提出 CodeMMLU,这是一个全面的多选题基准测试,旨在评估大语言模型在软件与代码理解方面的深度。CodeMMLU 包含近两万道题目,涵盖多个领域,包括代码分析、缺陷检测以及多种编程语言中的软件工程原则。与传统基准测试侧重代码生成不同,CodeMMLU 评估模型在代码修复、执行推理和填空挑战等广泛任务上的推理能力。我们的广泛评估显示,甚至是最先进的模型在 CodeMMLU 上也表现不佳,凸显了超越生成能力后理解能力的显著不足。通过强调代码理解与有效 AI 辅助开发之间的关键联系,CodeMMLU 为推动更可靠、更具能力的编码助手提供了重要资源。
引用
@article{arxiv.2410.01999,
title = {CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs},
author = {Dung Nguyen Manh and Thang Phan Chau and Nam Le Hai and Thong T. Doan and Nam V. Nguyen and Quang Pham and Nghi D. Q. Bui},
journal= {arXiv preprint arXiv:2410.01999},
year = {2025}
}