中文

PENTACET 数据——2300 万条上下文代码注释与 25 万条 SATD 注释

软件工程 2023-08-14 v2 机器学习

摘要

大多数自承认技术债务(SATD)研究利用 'TODO' 和 'FIXME' 等显式 SATD 特征进行 SATD 检测。仔细审视发现,若干 SATD 研究使用简单的 SATD('易查找')代码注释,而不带上下文数据(前文与后文源代码上下文)。本文通过 PENTACET(或称 5C 数据集)数据弥补这一缺口。PENTACET 是一个按贡献者整理的大规模上下文代码注释集,也是最为广泛的 SATD 数据。我们挖掘了 9,096 个开源软件 Java 项目,总计 4.35 亿行代码。成果是一个包含 2300 万条代码注释、每条注释的前文与后文源代码上下文,以及超过 250,000 条标注为 SATD 的注释的数据集,包括 '易查找' 和 '难查找' SATD。我们相信 PENTACET 数据将推动使用人工智能技术的 SATD 研究。

关键词

引用

@article{arxiv.2303.14029,
  title  = {PENTACET data -- 23 Million Contextual Code Comments and 250,000 SATD comments},
  author = {Murali Sridharan and Leevi Rantala and Mika Mäntylä},
  journal= {arXiv preprint arXiv:2303.14029},
  year   = {2023}
}

备注

Accepted in MSR 2023 Tools and Data Showcase