中文

数据集的误用如何损害语义克隆检测

软件工程 2025-05-08 v1

摘要

BigCloneBench 是一个知名且被广泛用于评估克隆检测工具召回率的大规模数据集。它对克隆检测研究大有裨益,并已成为评估克隆检测工具性能的标准。最近,它也被广泛用作数据集,以评估机器学习方法在功能或语义相似性方面的语义克隆检测或代码相似性检测。本文表明,将 BigCloneBench 用作学习或评估语义代码相似性的真值存在问题,并强调了影响 BigCloneBench 真值质量的几个方面。对 406 对 Weak Type-3/Type-4 克隆对的具有统计显著性的随机样本进行人工调查发现,其中 93% 不具备相似功能,因此被误标。在对 179 篇使用 BigCloneBench 作为数据集的论文进行文献综述时,我们发现 139 篇论文使用 BigCloneBench 评估语义克隆检测,且其结果的有效性受到误标的威胁。因此,这些论文通常报告了高 F1 分数(例如高于 0.9),这表明模型对数据集特定的伪影产生了过拟合,而非实现了真正的语义相似性检测。我们强调,将 BigCloneBench 用于评估 Type-1、Type-2 和 Type-3 克隆的语法或文本克隆检测的预期目的仍然是有效的。我们认可 BigCloneBench 在过去二十年传统克隆检测研究中的重要贡献。然而,在不仔细考虑其局限性的情况下,将 BigCloneBench 超出预期目的使用已导致了误导性的结果和结论,并可能损害了语义克隆检测领域。

关键词

引用

@article{arxiv.2505.04311,
  title  = {How the Misuse of a Dataset Harmed Semantic Clone Detection},
  author = {Jens Krinke and Chaiyong Ragkhitwetsagul},
  journal= {arXiv preprint arXiv:2505.04311},
  year   = {2025}
}