中文

关于 Just-in-time 缺陷预测校准的研究

软件工程 2025-04-17 v1 机器学习

摘要

即时缺陷预测(JIT DP)利用机器学习技术识别含缺陷的代码提交,从而使质量保证(QA)团队能够通过聚焦最可能包含缺陷的提交来更有效地分配资源。尽管 JIT DP 技术在预测准确性方面带来了改进,但它们仍然容易受到误分类错误的影响,如误报和漏报。这可能导致资源浪费或缺陷未被发现,这在 QA 资源有限的情况下尤为关键。为了缓解这些挑战并保持 JIT DP 工具的实际实用性,必须估计预测的可靠性,即计算置信度得分。这样的得分可以帮助实践者确定预测的可信度,从而更有效地对其进行优先级排序。计算置信度得分的一种简单方法是提取每个预测对应的预测概率,并将其用作置信度指示器。然而,为了使这些概率可靠地 serve 为置信度得分,预测模型必须是良好校准的,这意味着预测概率必须准确地表示每个预测被正确预测的真实可能性。校准不当是现代机器学习模型中常见的现象,会扭曲概率得分,使其与实际正确性概率不一致。本研究评估了三种 JIT DP 技术的校准情况,以确定它们是否存在以及在何种程度上存在校准不当。此外,我们评估了后校准方法是否可以改善现有 JIT 缺陷预测模型的校准。我们的结果表明,所评估的所有 JIT DP 模型都存在一定程度的校准不当,平均绝对差 (ECE) 范围在 2%至35%之间。此外,后校准方法并不一致地改善校准。

关键词

引用

@article{arxiv.2504.12051,
  title  = {On the calibration of Just-in-time Defect Prediction},
  author = {Xhulja Shahini and Jone Bartel and Klaus Pohl},
  journal= {arXiv preprint arXiv:2504.12051},
  year   = {2025}
}