中文

基于预训练模型的可操作警告识别:可行性研究

软件工程 2024-03-06 v1

摘要

可操作警告识别(AWI)在提高静态代码分析器的可用性方面起着关键作用。目前,基于机器学习(ML)的AWI方法(主要从标记的警告中学习AWI分类器)非常普遍。然而,这些方法仍然面临性能受限的问题,因为它们直接依赖有限数量的标记警告来开发分类器。最近,预训练模型(PTM)通过数十亿文本/代码标记进行训练,并在各种代码相关任务上取得了显著成功,可能能够规避上述问题。然而,PTM在AWI上的性能尚未得到系统研究,这留下了理解其优缺点的空白。在本文中,我们首次探索了将各种PTM应用于AWI的可行性。通过对来自10个大型开源项目的10K+ SpotBugs警告进行广泛评估,我们观察到所有研究的PTM一致比最先进的基于ML的AWI方法好9.85%~21.12%。此外,我们研究了典型基于PTM的AWI工作流中三个主要方面(即数据预处理、模型训练和模型预测)的影响。进一步,我们确定了当前PTM在AWI上表现不佳的原因。基于我们的发现,我们提供了若干实用指南,以在未来工作中增强基于PTM的AWI。

关键词

引用

@article{arxiv.2403.02716,
  title  = {Pre-trained Model-based Actionable Warning Identification: A Feasibility Study},
  author = {Xiuting Ge and Chunrong Fang and Quanjun Zhang and Daoyuan Wu and Bowen Yu and Qirui Zheng and An Guo and Shangwei Lin and Zhihong Zhao and Yang Liu and Zhenyu Chen},
  journal= {arXiv preprint arXiv:2403.02716},
  year   = {2024}
}