CodeScope:一种基于执行的用于评估 LLM 代码理解与生成的多语言多任务多维基准
计算与语言
2024-06-10 v3 人工智能
软件工程
摘要
大语言模型(LLMs)在辅助人类编程和促进编程自动化方面已展现出卓越性能。然而,现有用于评估 LLM 代码理解与生成能力的基准存在严重局限。首先,多数基准不充分,因其聚焦于狭窄的流行编程语言与特定任务范围,而现实软件开发场景显示出对多语言、多任务编程环境以实现系统以满足多样需求的迫切需求。其次,多数基准未能考虑所生成代码的实际可执行性及其执行结果的一致性。为弥合现有基准与实际应用期望间的差距,我们引入 CodeScope,一种基于执行的、多语言、多任务、多维评估基准,用于全面度量 LLM 在编程任务上的能力。CodeScope 涵盖 43 种编程语言与八项编码任务。它从三个维度(视角)评估 LLM 的编码表现:长度、难度与效率。为促进基于执行的代码生成评估,我们开发了 MultiCodeEngine,一种支持 14 种编程语言的自动化代码执行引擎。最后,我们系统评估并分析了八个主流 LLM,并展示了与其他基准相比,CodeScope 在评估 LLM 代码理解与生成任务上更优的广度与挑战性。CodeScope 基准与代码公开于 https://github.com/WeixiangYAN/CodeScope。
引用
@article{arxiv.2311.08588,
title = {CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation},
author = {Weixiang Yan and Haitian Liu and Yunkun Wang and Yunzhe Li and Qian Chen and Wen Wang and Tingyu Lin and Weishan Zhao and Li Zhu and Hari Sundaram and Shuiguang Deng},
journal= {arXiv preprint arXiv:2311.08588},
year = {2024}
}
备注
Accepted by ACL 2024 main conference