PENTACET 数据——2300 万条上下文代码注释与 25 万条 SATD 注释
软件工程
2023-08-14 v2 机器学习
摘要
大多数自承认技术债务(SATD)研究利用 'TODO' 和 'FIXME' 等显式 SATD 特征进行 SATD 检测。仔细审视发现,若干 SATD 研究使用简单的 SATD('易查找')代码注释,而不带上下文数据(前文与后文源代码上下文)。本文通过 PENTACET(或称 5C 数据集)数据弥补这一缺口。PENTACET 是一个按贡献者整理的大规模上下文代码注释集,也是最为广泛的 SATD 数据。我们挖掘了 9,096 个开源软件 Java 项目,总计 4.35 亿行代码。成果是一个包含 2300 万条代码注释、每条注释的前文与后文源代码上下文,以及超过 250,000 条标注为 SATD 的注释的数据集,包括 '易查找' 和 '难查找' SATD。我们相信 PENTACET 数据将推动使用人工智能技术的 SATD 研究。
引用
@article{arxiv.2303.14029,
title = {PENTACET data -- 23 Million Contextual Code Comments and 250,000 SATD comments},
author = {Murali Sridharan and Leevi Rantala and Mika Mäntylä},
journal= {arXiv preprint arXiv:2303.14029},
year = {2023}
}
备注
Accepted in MSR 2023 Tools and Data Showcase