中文

面向有偿开源开发者的识别:以 Mozilla 开发者为例

软件工程 2018-10-04 v1

摘要

开源开发包含受雇与志愿软件开发者两者的贡献。当我们考虑将研究结果迁移至不含志愿开发者的闭源软件行业时,识别开发者的这一身份状态十分重要。尽管许多研究已考虑开发者的雇佣状态,但由于缺乏准确的自动化方法,该信息通常靠人工收集。本文提出使用机器学习预测有偿与无偿开源开发的初步步骤,并将我们的结果与先前工作中使用的自动化技术进行比较。基于来自 Mozilla 的代码仓库元数据以及人工收集的雇佣状态,我们构建了最活跃开发者(包括 Mozilla 志愿与受雇者)的数据集。我们依据开发者通常的提交时间模式定义了一组度量,并使用不同的分类方法(逻辑回归、分类树和随机森林)。结果表明,我们使用随机森林所提方法以 0.75 的 AUC 识别有偿与无偿提交,高于先前所用最佳自动化方法获得的 0.64 AUC。

关键词

引用

@article{arxiv.1804.02153,
  title  = {Towards Identifying Paid Open Source Developers - A Case Study with Mozilla Developers},
  author = {Maëlick Claes and Mika Mäntylä and Miikka Kuutila and Umar Farooq},
  journal= {arXiv preprint arXiv:1804.02153},
  year   = {2018}
}

备注

International Conference on Mining Software Repositories (MSR) 2018