TSSB-3M:大规模挖掘单语句缺陷
软件工程
2022-01-31 v1 编程语言
摘要
单语句缺陷是现代缺陷检测与自动程序修复方法评估中最重要的组成部分之一。由于仅影响单条语句,单语句缺陷代表了一类常被开发者忽视的缺陷,同时又足够小以便被自动方法检测与修复。随着数据驱动的自动修复的兴起,以百万级规模提供单语句缺陷比以往任何时候都更为重要;不仅用于测试这些方法,也用于为训练提供充足的真实世界示例。为提供此规模的缺陷修复数据集,我们发布了两个名为 SSB-9M 和 TSSB-3M 的数据集。SSB-9M 提供了来自超过 50 万个开源 Python 项目的超过 900 万个通用单语句缺陷修复的集合,而 TSSB-3M 聚焦于超过 300 万个仅能通过单条语句修改修复的单语句缺陷。为促进未来研究与实证调查,我们将每个缺陷修复标注为 Python 典型的 20 种单语句缺陷(SStuB)模式之一,并将代码变更刻画为一系列 AST 修改。我们的初步调查显示,挖掘出的所有单语句缺陷修复中至少 40% 符合至少一种 SStuB 模式,且 72% 的多数缺陷可通过修复 SStuB 所需的相同句法修改来修复。
引用
@article{arxiv.2201.12046,
title = {TSSB-3M: Mining single statement bugs at massive scale},
author = {Cedric Richter and Heike Wehrheim},
journal= {arXiv preprint arXiv:2201.12046},
year = {2022}
}
备注
7 pages, 2 figures