利用 EMBLEM 改进数据标注(及其对缺陷预测的影响)
软件工程
2020-04-08 v3
摘要
识别有问题开发提交的标准自动方法可通过人机专长的增量应用大幅改进。在这种称为 EMBLEM 的方法中,AI 工具首先探索软件开发过程以标注最成问题的提交。人类随后运用其专长核查那些标注(可能导致 AI 更新其 SVM 学习器内的支持向量)。我们推荐这种人机协作,原因如下:当遇到新领域时,EMBLEM 可学习更好的方式以标注哪些评论指向真实问题;此外,在针对 9 个开源软件项目的研究中,通过 EMBLEM 增量应用人机协作进行标注比现有方法至少廉价一个数量级( 八倍)。进一步,EMBLEM 非常有效。在此探讨的数据集中,EMBLEM 更好的标注方法在几乎所有研究项目中显著提升了 与 G-scores 性能。
引用
@article{arxiv.1905.01719,
title = {Better Data Labelling with EMBLEM (and how that Impacts Defect Prediction)},
author = {Huy Tu and Zhe Yu and Tim Menzies},
journal= {arXiv preprint arXiv:1905.01719},
year = {2020}
}
备注
17 pages, 2 pages references, submitted for TSE journal