软件存储库代表性样本的创建
软件工程
2024-10-03 v2
摘要
软件存储库是经验软件工程中数据来源之一,主要位于数据矿工领域,旨在从软件项目的动态和实践中提取知识。随着社交编码平台如 GitHub 的出现,研究人员现在可以访问数以百万计的软件存储库作为研究数据的来源。在如此庞大的数据量下,样本技术被用来创建更易于管理的数据集。数据的创建是一个关键步骤,研究人员必须根据一组感兴趣的变量小心选择存储库以创建代表性样本。然而,当前的样本方法通常基于随机选择或依赖于可能与研究研究无关的变量(例如流行度或活动性)。本文提出了一种创建软件存储库代表性样本的方法,其中这种代表性与存储库群体的特征以及实证研究的要求相匹配。我们以基于 Hugging Face 存储库的案例为例说明了我们的方案。
引用
@article{arxiv.2410.00639,
title = {On the Creation of Representative Samples of Software Repositories},
author = {June Gorostidi and Adem Ait and Jordi Cabot and Javier Luis Cánovas Izquierdo},
journal= {arXiv preprint arXiv:2410.00639},
year = {2024}
}
备注
The paper has been accepted for publication in the Proceedings of the 18th International Symposium on Empirical Software Engineering and Measurement (ESEM 2024)