中文

你的基准测试(仍然)有用吗?面向代码语言模型的动态基准测试

软件工程 2025-03-11 v1 计算与语言

摘要

在本文中,我们解决模型评估中的一个关键挑战:当模型在训练期间可能已经见过基准测试时,如何保持代码基准测试的有用性。我们引入了一种新颖的解决方案——动态基准测试框架,以应对这一挑战。给定一个代码理解或推理基准测试,我们的框架通过多种保持语义的变异动态地转换每个输入(即程序),以构建一个语法上全新但语义相同的基准测试。我们在动态基准测试上评估了十个流行的语言模型。我们的评估揭示了几个有趣或令人惊讶的发现:(1)所有模型的性能均显著低于以往;(2)部分模型之间的排名发生剧烈变化;(3)我们的动态基准测试能够抵御数据污染问题。

关键词

引用

@article{arxiv.2503.06643,
  title  = {Is Your Benchmark (Still) Useful? Dynamic Benchmarking for Code Language Models},
  author = {Batu Guan and Xiao Wu and Yuanyuan Yuan and Shaohua Li},
  journal= {arXiv preprint arXiv:2503.06643},
  year   = {2025}
}

备注

14 pages, 7 figures