中文

CODEMENV:大语言模型在代码迁移上的基准测试

软件工程 2025-06-03 v1 人工智能 计算与语言 机器学习

摘要

大语言模型(LLM)在各种软件工程任务中展现出了卓越的能力;然而,它们在代码迁移(即调整代码以在不同环境中运行)方面的有效性仍未得到充分研究。在本工作中,我们引入了 CODEMENV:跨环境代码迁移,这是一个专门设计用于评估 LLM 在代码迁移场景下能力的新基准。CODEMENV 包含 922 个示例,涵盖 19 个 Python 和 Java 包,并覆盖三个核心任务:(1) 识别与特定版本不兼容的函数,(2) 检测函数定义的变化,以及 (3) 使代码适应目标环境。在 CODEMENV 上对七个 LLM 进行的实验评估显示,平均 pass@1 率为 26.50%,其中 GPT-4O 取得了 43.84% 的最高分。主要发现包括: LLM 往往在处理较新的函数版本时更为熟练,这有助于迁移遗留代码; LLM 有时会表现出逻辑不一致,识别出与预期迁移环境无关的函数变化。数据集可在 https://github.com/xdshen-ai/Benchmark-of-Code-Migration 获取。

关键词

引用

@article{arxiv.2506.00894,
  title  = {CODEMENV: Benchmarking Large Language Models on Code Migration},
  author = {Keyuan Cheng and Xudong Shen and Yihao Yang and Tengyue Wang and Yang Cao and Muhammad Asif Ali and Hanbin Wang and Lijie Hu and Di Wang},
  journal= {arXiv preprint arXiv:2506.00894},
  year   = {2025}
}

备注

Accepted by ACL 2025 Findings