FRUGAL:为软件分析开启半监督学习
软件工程
2021-08-24 v1 机器学习
摘要
标准软件分析通常需拥有大量带标签数据,方能构建具有可接受性能的模型。然而,已有工作表明此类要求可能代价高昂,标注数千次提交需耗时数周,且在涉足新研究问题与领域时并非总可获得。无监督学习是从无标签数据中学习隐藏模式的一个有前景的方向,其仅在缺陷预测中被广泛研究。尽管如此,无监督学习单独使用可能低效,且尚未在其他领域(如静态分析与问题关闭时间)中被探索。受此文献空白与技术限制驱动,我们提出 FRUGAL,一种调优的半监督方法,其构建于简单优化方案之上,无需复杂(如深度学习者)且昂贵(如 100% 人工标注数据)的方法。FRUGAL 优化无监督学习器的配置(通过简单网格搜索),同时验证我们在预测前仅标注 2.5% 数据的设计决策。如本文实验所示,FRUGAL 优于可采用的 SOTA 静态代码警告识别器与问题关闭时间预测器,同时将标注成本降低 40 倍(从 100% 降至 2.5%)。因此我们断言 FRUGAL 可节省可观的数据标注工作量,尤其在验证已有工作与研究新问题时。基于本工作,我们建议复杂且昂贵方法的倡导者应始终将此类方法与更简单廉价的替代方案进行基线比较。例如,像 FRUGAL 这样的半监督学习器可作为 SOTA 软件分析的基线。
引用
@article{arxiv.2108.09847,
title = {FRUGAL: Unlocking SSL for Software Analytics},
author = {Huy Tu and Tim Menzies},
journal= {arXiv preprint arXiv:2108.09847},
year = {2021}
}
备注
Accepted for ASE 2022