中文

CodeUpdateArena:用于 API 更新知识编辑的基准测试

计算与语言 2025-04-04 v3 软件工程

摘要

大型语言模型(LLM)正越来越多地被用于合成和推理源代码。然而,这些模型的知识是静态的,这并不反映出它们调用的库和 API 函数正在不断演化,功能被添加或更改。虽然已有许多基准测试评估LLM如何生成代码,但目前尚无工作研究LLM关于代码 API 函数知识的更新方式。为填补这一空白,我们提出CodeUpdateArena,这是一个用于代码领域知识编辑的基准测试。我们基准测试中的一个实例由一个合成的 API 函数更新配对一个使用该更新功能的程序综合示例组成;我们的目标是在推理时不提供该更新的文档,使LLM能够解决该程序综合示例。与在文本中进行知识编辑相比,此处的成功更具挑战性:代码LLM必须正确地推理修改后函数的语义,而不仅仅是复现其语法。我们的数据集通过首先让GPT-4生成原子且可执行的函数更新来构建。然后,对于每个更新,我们生成程序综合示例,其代码解决方案倾向于使用该更新。我们的基准测试涵盖了对7个多样化Python包中54个函数的各种类型更新,总计670个程序综合示例。我们的实验表明,将该更新的文档添加到开源代码LLM(如DeepSeek、CodeLlama)中,无法让它们在解决问题时吸收这些更改,现有的知识编辑技术也有很大的改进空间。我们希望我们的基准测试能激发新的方法,用于代码LLM的知识更新。

关键词

引用

@article{arxiv.2407.06249,
  title  = {CodeUpdateArena: Benchmarking Knowledge Editing on API Updates},
  author = {Zeyu Leo Liu and Shrey Pandit and Xi Ye and Eunsol Choi and Greg Durrett},
  journal= {arXiv preprint arXiv:2407.06249},
  year   = {2025}
}

备注

Under Review