中文

面向大规模代码编辑的大型语言模型系统评估基准——RES-Q

计算与语言 2024-06-27 v2

摘要

大型语言模型(LLM)的指令跟随能力催生了一类能够处理复杂任务(如编辑大型代码仓库)的 LLM-based 系统。鉴于 LLM 行为对提示变化极其敏感且不可预测,为这些系统的未来迭代提供稳健的评估工具至关重要。我们提出 RES-Q,一个基于自然语言指令的基准,用于评估存储库编辑系统,包含 100 个源自真实 GitHub 提交的手工制作存储库编辑任务。给定编辑指令和代码存储库,RES-Q 评估 LLM 系统理解指令、导航存储库以收集相关信息,并构建满足指定条件的适当编辑的能力。我们认为,这种评估方式解决了传统基准的问题,为模型能力提供了更全面的评估。我们在基于 Qurrent OS 的存储库编辑系统上评估了各种最先进的 LLM 作为语言代理。尽管它们在 HumanEval 上仅有 1% 的 pass@1 性能差异,但我们发现Claude Sonnet 3.5 在 RES-Q 上相较于 GPT-4o 高出 12% 的 pass@1,表明 RES-Q 具备区分模型能力的潜力,而传统基准正逼近饱和。我们进一步研究了 token 效率、性能与现有基准的关系,以及封闭式与开源 LLM 之间的有趣差异。代码和数据集均可在 https://github.com/Qurrent-AI/RES-Q 获取。

关键词

引用

@article{arxiv.2406.16801,
  title  = {RES-Q: Evaluating Code-Editing Large Language Model Systems at the Repository Scale},
  author = {Beck LaBash and August Rosedale and Alex Reents and Lucas Negritto and Colin Wiel},
  journal= {arXiv preprint arXiv:2406.16801},
  year   = {2024}
}