中文

处理细粒度源代码变更的大规模数据集

软件工程 2019-10-22 v1

摘要

在Big Code时代,当研究者寻求研究数量不断增长的仓库以支持其发现时,数据处理阶段可能需要操纵数百万乃至更多的记录。本文关注涉及细粒度AST级源代码变更的研究。我们介绍了如何扩展CodeDistillery源代码挖掘框架的数据操纵能力,以缓解细粒度源代码变更大规模数据集的处理。我们引入的能力使研究者能够高度自动化其仓库挖掘过程,并精简数据获取与处理阶段。这些能力已成功用于开展若干研究,期间处理了数千万条细粒度源代码变更。

关键词

引用

@article{arxiv.1910.08908,
  title  = {Processing Large Datasets of Fined Grained Source Code Changes},
  author = {Stanislav Levin and Amiram Yehudai},
  journal= {arXiv preprint arXiv:1910.08908},
  year   = {2019}
}

备注

Preprint