中文

软件分析的数据质量反模式

软件工程 2024-08-23 v1 人工智能

摘要

背景:数据质量对于软件分析尤其是机器学习(ML)应用如软件缺陷预测(SDP)至关重要。尽管机器学习在软件工程中广泛应用,但数据质量反模式对这些模型的影响仍未得到充分探索。目标:本研究发展一种ML特定数据质量反模式的分类体系,并评估这些反模式对软件分析模型性能和解释的影响。方法:我们通过文献综述识别了八种类型和十四种子类型的ML特定数据质量反模式。我们进行实验以确定这些反模式在SDP数据中出现的频率(RQ1),评估清洗顺序对模型性能的影响(RQ2),评估反模式移除对性能的影响(RQ3),并检查使用不同反模式构建的模型在解释一致性方面的情况(RQ4)。结果:在我们的SDP案例研究中,我们识别了九种反模式。超过90%的反模式在行和列级别重叠,使清洗优先级复杂化并增加过度数据删除的风险。清洗顺序对ML模型性能有显著影响,神经网络对清洗顺序的变化比简单的逻辑回归模型更具韧性。当其他反模式被清洗后,Tailed Distributions和Class Overlap等反模式与性能指标呈统计显著相关性。使用不同反模式构建的模型在解释结果方面显示中等一致性。结论:不同反模式的清洗顺序影响ML模型性能。五种反模式在其他反模式被清洗后与模型性能呈统计显著相关性。此外,数据质量反模式对模型解释有中等程度的影响。

关键词

引用

@article{arxiv.2408.12560,
  title  = {Data Quality Antipatterns for Software Analytics},
  author = {Aaditya Bhatia and Dayi Lin and Gopi Krishnan Rajbahadur and Bram Adams and Ahmed E. Hassan},
  journal= {arXiv preprint arXiv:2408.12560},
  year   = {2024}
}