Copilot Arena:面向代码LLM野外评估的平台
软件工程
2025-02-14 v1
摘要
评估大型语言模型(LLM)在野外编程能力是一个充满挑战的任务, 尚无明确解决方案。我们引入Copilot Arena, 一个通过原生集成到开发人员工作环境中来收集用户偏好的数据平台。Copilot Arena包括一种用于比较模型输出的新颖界面、优化以减少延迟的抽样策略以及一种启用代码完成功能的提示方案。Copilot Arena已服务超过450万个建议, 来自10个模型, 并收集超过1.1万对成对判断。我们的结果突显了集成环境中模型评估的重要性。我们发现, Copilot Arena的模型排名与现有评估不同, 我们将此归因于Copilot Arena所包含的更真实数据和任务分布。我们还确定了关于代码偏好的新见解, 例如观察到用户偏好在编程语言间保持一致, 但由于任务类别不同, 偏好存在显著差异。我们开源Copilot Arena并发布数据, 以促进以人类为中心的评估并加深对编程助手的理解。
引用
@article{arxiv.2502.09328,
title = {Copilot Arena: A Platform for Code LLM Evaluation in the Wild},
author = {Wayne Chi and Valerie Chen and Anastasios Nikolas Angelopoulos and Wei-Lin Chiang and Aditya Mittal and Naman Jain and Tianjun Zhang and Ion Stoica and Chris Donahue and Ameet Talwalkar},
journal= {arXiv preprint arXiv:2502.09328},
year = {2025}
}