中文

SWE-Arena:一个用于评估软件工程基础模型的交互式平台

软件工程 2025-10-13 v5 机器学习

摘要

基础模型(FMs),特别是大语言模型(LLMs),在代码生成、调试和需求细化等多种软件工程(SE)任务中展现出巨大潜力。尽管取得了这些进展,现有的评估框架仍不足以评估模型在软件工程活动特有的迭代式、上下文丰富的工作流中的表现。为解决这一局限,我们引入了SWE-Arena,一个旨在评估软件工程任务中基础模型的交互式平台。SWE-Arena提供了一个透明、开源排行榜,支持多轮对话工作流,并能进行端到端模型比较。该平台引入了新颖的度量指标,包括通过自对弈匹配衡量模型输出一致性的模型一致性得分,以及在考虑达成结论所需交互轮次的同时评估模型性能的对话效率指数。此外,SWE-Arena还整合了一项名为RepoChat的新功能,该功能可自动将仓库相关上下文(例如,议题、提交、拉取请求)注入对话,进一步使评估与实际开发流程对齐。本文概述了SWE-Arena的设计与能力,强调了其在推动软件工程中基础模型的评估与实际应用方面的潜力。

关键词

引用

@article{arxiv.2502.01860,
  title  = {SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering},
  author = {Zhimin Zhao},
  journal= {arXiv preprint arXiv:2502.01860},
  year   = {2025}
}

备注

Check the online arena at https://huggingface.co/spaces/SWE-Arena/Software-Engineering-Arena