从 20 亿 Git 提交中提取的 3800 万作者 ID 的身份解析数据集与方法
软件工程
2020-03-31 v2
摘要
从开源项目收集的数据为建模大型软件生态系统提供了手段,但常受数据质量问题的困扰,具体而言,代码提交中的多个作者标识字符串实际上可能关联同一开发者。尽管已提出许多方法解决此问题,它们要么是需手动调整的启发式方法,要么需要过多计算时间来进行成对比较,例如 World of Code 集合中 3800 万作者 ID 的情形。在本文中,我们提出一种方法,在该整个数据集中找出属于单一开发者的所有作者 ID,并共享被发现具有别名的全部作者 ID 列表。为此,我们首先创建潜在相连作者 ID 的块,随后使用机器学习模型预测这些潜在相关的 ID 中哪些属于同一开发者。我们处理了约 3800 万作者 ID,发现约 1480 万 ID 具有别名,分属 540 万不同开发者,每位开发者别名数的中位数为 2。该数据集可用于在整体 OSS 生态系统层面创建更精确的开发者行为模型,并可用于提供快速解析新作者 ID 的服务。
引用
@article{arxiv.2003.08349,
title = {A Dataset and an Approach for Identity Resolution of 38 Million Author IDs extracted from 2B Git Commits},
author = {Tanner Fry and Tapajit Dey and Andrey Karnauch and Audris Mockus},
journal= {arXiv preprint arXiv:2003.08349},
year = {2020}
}