中文

CodeArena:面向 LLM 代码生成的集体评估平台

软件工程 2025-03-04 v1

摘要

大型语言模型 (LLM) 通过融合自然语言和编程语法的卓越理解能力,重塑了代码生成领域,显著提升了开发者生产力。这一进展催生了大量定量评估其编程能力的努力。然而,基准泄露、数据散落以及系统可访问性有限等持续挑战,仍阻碍了及时且准确的评估。为此,我们引入 CodeArena,一个针对 LLM 代码生成的在线评估框架。其核心创新在于集体评估机制,能够动态根据所有参与模型的整体表现重新校准 individual 模型得分,从而减轻因广泛基准泄露导致的评分偏差。此外,CodeArena 确保所有提交的解决方案和测试用例公开访问,并提供面向自动化的 API,以简化代码评估工作流程。我们的主要贡献包括:(1) 用于无偏评估的集体评估系统、(2) 解决方案和测试用例的公共存储库、(3) 用于无缝集成的自动化就绪 API。

关键词

引用

@article{arxiv.2503.01295,
  title  = {CodeArena: A Collective Evaluation Platform for LLM Code Generation},
  author = {Mingzhe Du and Anh Tuan Luu and Bin Ji and Xiaobao Wu and Dong Huang and Terry Yue Zhuo and Qian Liu and See-Kiong Ng},
  journal= {arXiv preprint arXiv:2503.01295},
  year   = {2025}
}