YABLoCo:又一个长上下文代码生成基准
计算与语言
2025-05-08 v1 人工智能
软件工程
摘要
大型语言模型展现出解决各种编程任务的能力,包括代码生成。通常,LLM 的性能是在具有数千行代码的中小型上下文窗口的基准上衡量的。与此同时,在真实的软件项目中,代码库可多达数百万行代码。本文通过构建长上下文代码生成基准(YABLoCo)填补了这一空白。该基准包含一个测试集,由从四个包含数千个函数的大型代码库中选取的 215 个函数组成。该数据集包含了函数的元数据、具有不同依赖级别的函数上下文、文档字符串、函数体以及每个代码库的调用图。本文提出了该贡献的三个关键方面。首先,该基准针对 C 和 C++ 大型代码库中的函数体生成,这两种语言在以前的基准中未被涵盖。其次,该基准包含从 200K 到 2,000K 行代码的大型代码库。第三,我们贡献了一个可扩展的评估流水线,用于高效计算目标指标,以及一个用于生成代码可视化分析的工具。总体而言,这三个方面允许对 C 和 C++ 大型代码库中的代码生成进行评估。
引用
@article{arxiv.2505.04406,
title = {YABLoCo: Yet Another Benchmark for Long Context Code Generation},
author = {Aidar Valeev and Roman Garaev and Vadim Lomshakov and Irina Piontkovskaya and Vladimir Ivanov and Israel Adewuyi},
journal= {arXiv preprint arXiv:2505.04406},
year = {2025}
}
备注
Presented at LLM4Code 2025 Workshop co-located wtih ICSE 2025