Long Code Arena:用于长上下文代码模型的基准测试套件
机器学习
2024-06-18 v1 人工智能
信息检索
软件工程
摘要
如今,代码和自然语言处理领域正在迅速发展。特别是,模型在处理长上下文窗口方面变得更好,过去几年支持的上下文大小增加了多个数量级。然而,对于超出单个文件上下文的代码处理基准测试仍然不足,而最流行的基准测试局限于单个方法。通过本工作,我们旨在通过引入 Long Code Arena 来弥合这一差距,这是一个包含六个基准测试的套件,用于需要项目范围上下文的代码处理任务。这些任务涵盖代码处理的不同方面:库式代码生成、CI 构建修复、项目级代码完成、提交信息生成、错误定位和模块总结。对于每个任务,我们提供手动验证的测试数据集、评估套件以及基于流行大语言模型的开源基线解决方案,以展示数据集的用法并简化其他研究人员的采用。我们在 HuggingFace Spaces 上发布了基准页面,包含排行榜、HuggingFace Hub 上所有数据集的链接,以及包含基线代码的 GitHub 仓库链接:https://huggingface.co/spaces/JetBrains-Research/long-code-arena。
引用
@article{arxiv.2406.11612,
title = {Long Code Arena: a Set of Benchmarks for Long-Context Code Models},
author = {Egor Bogomolov and Aleksandra Eliseeva and Timur Galimzyanov and Evgeniy Glukhov and Anton Shapkin and Maria Tigina and Yaroslav Golubev and Alexander Kovrigin and Arie van Deursen and Maliheh Izadi and Timofey Bryksin},
journal= {arXiv preprint arXiv:2406.11612},
year = {2024}
}
备注
54 pages, 4 figures, 22 tables