中文

LessLeak-Bench:对 LLM 在 83 个软件工程基准中的数据泄漏的首次系统性调查

软件工程 2025-02-11 v1 人工智能 计算与语言

摘要

大型语言模型 (LLM) 在代码生成和自动化程序修复等软件工程 (SE) 任务中广泛应用。然而,由于依赖广泛且常不披露的预训练数据集,存在数据泄漏的顾虑,即评估基准数据在模型构建阶段意外被“看到”。数据泄漏问题可能严重削弱 LLM 基于研究和评估的有效性。尽管 LLM 在 SE 社区中的使用日益增多,但尚无针对 LLM 在 SE 基准中数据泄漏程度的综合性研究。为填补这一空白,本文提出了对 83 个 SE 基准中数据泄漏的首次大规模分析。我们的结果显示,总体而言,SE 基准中的数据泄漏很小,Python、Java 和 C/C++ 基准的平均泄漏比例分别为仅 4.8%、2.8% 和 0.7%。然而,一些基准表现出相对较高的泄漏比例,这引发了对其评估偏差的担忧。例如,QuixBugs 和 BigCloneBench 的泄漏比例分别为 100.0% 和 55.7%。此外,我们观察到数据泄漏对 LLM 评估具有显著影响。我们还识别出导致高数据泄漏的关键原因,如基准数据直接包含在预训练数据集中以及使用类似 LeetCode 的编码平台进行基准构建。为解决数据泄漏问题,本文引入了 LessLeak-Bench,一个从 83 个 SE 基准中移除泄漏样本的新基准,旨在为未来研究中的可靠 LLM 评估提供支持。我们的研究增进了对 SE 基准中数据泄漏的理解,并为 LLM 在 SE 领域的未来研究提供了宝贵见解。

关键词

引用

@article{arxiv.2502.06215,
  title  = {LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks},
  author = {Xin Zhou and Martin Weyssow and Ratnadira Widyasari and Ting Zhang and Junda He and Yunbo Lyu and Jianming Chang and Beiqi Zhang and Dan Huang and David Lo},
  journal= {arXiv preprint arXiv:2502.06215},
  year   = {2025}
}

备注

25 pages