ZeroIn:刻画软件仓库中提交的数据分布
软件工程
2022-04-19 v1
摘要
现代软件开发基于一系列快速的增量变更,这些变更由具有不同经验和专业水平的开发者协作地对大型源代码仓库做出。ZeroIn 项目旨在分析这些动态现象的元数据,包括关于仓库、提交和开发者的数据,以在提交到达仓库时快速且准确地标记其质量。在此背景下,本文从最能捕捉数据集中趋势的数据分布角度对软件开发元数据进行刻画。为此分析了多个数据集,包括关于开发者特征的 Stack Overflow 以及包含超过 4.52 亿个仓库和 1600 万次提交的 GitHub 数据。该刻画旨在能够生成多个合成数据集,用于训练和测试新颖的基于机器学习的解决方案,以提升软件在演化过程中的可靠性。它也旨在服务于开发过程,以利用跨仓库与开发者聚合空间中许多关键特征向量之间的潜在关联。本文的数据刻画设计用于输入 ZeroIn 的机器学习组件,包括应用二分类器对存在缺陷的软件提交进行早期标记,以及开发基于图的学习方法以利用仓库、提交和开发者集合间的稀疏连接。
引用
@article{arxiv.2204.07863,
title = {ZeroIn: Characterizing the Data Distributions of Commits in Software Repositories},
author = {Kalyan Perumalla and Aradhana Soni and Rupam Dey and Steven Rich},
journal= {arXiv preprint arXiv:2204.07863},
year = {2022}
}
备注
42 pages, 68 figures, 7 tables