CODEMENV:大语言模型在代码迁移上的基准测试
软件工程
2025-06-03 v1 人工智能
计算与语言
机器学习
摘要
大语言模型(LLM)在各种软件工程任务中展现出了卓越的能力;然而,它们在代码迁移(即调整代码以在不同环境中运行)方面的有效性仍未得到充分研究。在本工作中,我们引入了 CODEMENV:跨环境代码迁移,这是一个专门设计用于评估 LLM 在代码迁移场景下能力的新基准。CODEMENV 包含 922 个示例,涵盖 19 个 Python 和 Java 包,并覆盖三个核心任务:(1) 识别与特定版本不兼容的函数,(2) 检测函数定义的变化,以及 (3) 使代码适应目标环境。在 CODEMENV 上对七个 LLM 进行的实验评估显示,平均 pass@1 率为 26.50%,其中 GPT-4O 取得了 43.84% 的最高分。主要发现包括: LLM 往往在处理较新的函数版本时更为熟练,这有助于迁移遗留代码; LLM 有时会表现出逻辑不一致,识别出与预期迁移环境无关的函数变化。数据集可在 https://github.com/xdshen-ai/Benchmark-of-Code-Migration 获取。
引用
@article{arxiv.2506.00894,
title = {CODEMENV: Benchmarking Large Language Models on Code Migration},
author = {Keyuan Cheng and Xudong Shen and Yihao Yang and Tengyue Wang and Yang Cao and Muhammad Asif Ali and Hanbin Wang and Lijie Hu and Di Wang},
journal= {arXiv preprint arXiv:2506.00894},
year = {2025}
}
备注
Accepted by ACL 2025 Findings