中文

利用众包复制和扩展定性分析:一项基于 GitHub 的案例研究

软件工程 2017-03-03 v2

摘要

由于复制和扩展定性研究存在困难,此类研究很少得到验证。因此,本文中我们利用众包的优势(低成本、速度快、劳动力可扩展)来复制并扩展一项最先进的定性研究。该定性研究探索了 20 个 GitHub 拉取请求,以了解影响拉取请求审批与合并结果的因素。作为一项二次研究,我们以 200 美元的成本使用众包,研究了来自 142 个 GitHub 项目的 250 个拉取请求。先前的定性发现被映射为面向众包工作者的问题。他们的答案被转换为二值特征,用以构建一个预测器,预测代码是否会被合并,中位 F1 分数达到 68%。对于同一大批拉取请求,通过使用先前定量结果定义的额外特征构建的预测器,中位 F1 分数可以达到 90%。基于这项案例研究,我们得出结论:结合不同类型的研究方法大有裨益。虽然定性洞察对于发现新颖见解非常有用,但它们可能难以扩展或复制。尽管如此,它们可以指导并定义使用(例如)众包加数据挖掘的可扩展二次研究的目标。另一方面,虽然数据挖掘方法可重现且可扩展到大数据集,但由于缺乏上下文信息,其结果可能严重错误。尽管如此,它们可用于检验从定性分析中获得的见解的稳定性和外部有效性。

关键词

引用

@article{arxiv.1702.08571,
  title  = {Replicating and Scaling up Qualitative Analysis using Crowdsourcing: A Github-based Case Study},
  author = {Di Chen and Kathryn T. Stolee and Tim Menzies},
  journal= {arXiv preprint arXiv:1702.08571},
  year   = {2017}
}

备注

Submitted to FSE'17, 12 pages