LibEvolutionEval:面向版本特定代码生成的基准与研究
软件工程
2025-05-07 v1 人工智能
摘要
近期代码完成模型的进步主要聚焦于本地文件上下文,但这些研究未充分捕捉真实世界软件开发中对快速演进公共库的需求。为填补这一空白,我们引入LibEvolutionEval,要求理解库的演进以准确执行行内代码补全。LibEvolutionEval提供由八个库(torch, torchvision, scipy, pil, tqdm, pyyaml, matplotlib, pandas)随时间演进构成的版本特定代码补全任务,并对两个活跃且维护良好的公共库:PyTorch和Matplotlib进行详尽分析。我们评估了流行的公共模型,发现公共库的演进显著影响模型性能。我们探索了通过检索版本特定库文档和提示技术来改善模型处理这些快速演进软件包能力的方法,为更好地处理快速演进的库进程指明了前景道路。
引用
@article{arxiv.2412.04478,
title = {LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation},
author = {Sachit Kuhar and Wasi Uddin Ahmad and Zijian Wang and Nihal Jain and Haifeng Qian and Baishakhi Ray and Murali Krishna Ramanathan and Xiaofei Ma and Anoop Deoras},
journal= {arXiv preprint arXiv:2412.04478},
year = {2025}
}