中文

用于 GitHub 仓库去重的数据集:扩展说明

软件工程 2023-12-05 v3

摘要

GitHub 项目可以通过该站的 fork 流程或 Git clone-push 序列被轻易复制。这对经验软件工程而言是个问题,因为它可能导致结果偏斜或机器学习模型训练不当。我们提供了一个包含 1060 万个互为副本的 GitHub 项目的数据集,并将每条记录与其项目的最终父项目相链接。最终父项目由沿六个指标的排序得出。相关项目被计算为一个 1820 万节点、1200 万边的去噪图(通过将有向边指向最终父项目而创建)的连通分量。该图通过过滤掉超过 30 个手工挑选的以及 230 万个模式匹配的聚团项目而创建。引发不必要聚团的项目通过反复可视化不相关重要项目之间的最短路径距离来识别。我们的数据集在一个现有的包含 180 万个项目的流行参考数据集中识别出了 3 万个重复项目。将我们的数据集与另一个用不同方法独立创建的数据集进行评估,发现存在显著重叠,但也存在归因于“哪些项目被视为相关”的操作性定义的差异。

关键词

引用

@article{arxiv.2002.02314,
  title  = {A Dataset for GitHub Repository Deduplication: Extended Description},
  author = {Diomidis Spinellis and Zoe Kotti and Audris Mockus},
  journal= {arXiv preprint arXiv:2002.02314},
  year   = {2023}
}

备注

33 pages, 33 figures, 17 listings