COMPASS:面向大型语言模型代码生成的多维基准测试
软件工程
2025-08-20 v1 人工智能
摘要
当前的代码生成基准测试主要关注功能正确性,而忽略了实际编程中两个关键方面:算法效率和代码质量。我们提出 COMPASS(COdility's Multi-dimensional Programming ASSessment),一个全面的评估框架,用于衡量代码生成在三个维度上的表现:正确性、效率和质量。COMPASS 包含来自真实 Codility 竞赛的 50 个竞赛编程问题,提供来自 393,150 份提交的真实人类基线。与现有基准测试将在测试用例通过后将低效算法与最优解视为等价不同,COMPASS 使用行业标准分析工具系统性地评估运行时效率和代码质量。我们的评估发现,三位领先的推理增强模型——Anthropic Claude Opus 4、Google Gemini 2.5 Pro 和 OpenAI O4-Mini-High——在获得高正确性得分并不一定会产生高效算法或可维护的代码。这一发现凸显了仅评估正确性而不评估其他维度的重要性,才能真正理解代码生成模型在实际场景中的能力。COMPASS 为未来致力于构建稳健、可靠且具备生产就绪能力的 AI 系统提供了指导框架,描绘了未来研究的道路。
引用
@article{arxiv.2508.13757,
title = {COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models},
author = {James Meaden and Michał Jarosz and Piotr Jodłowski and Grigori Melnik},
journal= {arXiv preprint arXiv:2508.13757},
year = {2025}
}