通过数据漂移检测缓解持续集成中ML模型退化:一项实证研究
软件工程
2023-07-18 v2
摘要
背景:机器学习(ML)方法正越来越多地用于自动化持续集成(CI)中的不同活动,例如测试用例优先级排序(TCP)。然而,由于CI环境的变化(更常被称为数据漂移),ML模型需要频繁重训练。此外,持续重训练ML模型消耗大量时间与精力。因此,迫切需要对合适方法进行识别与评估,以帮助减少CI环境中用于TCP的ML模型的重训练精力与时间。目的:本研究旨在探究使用数据漂移检测技术自动检测CI环境中用于TCP的ML模型重训练点的性能,且无需软件项目的详细知识。方法:我们采用Hellinger距离来识别输入数据数值与分布的变化,并将这些变化用作ML模型的重训练点。我们在多个数据集上评估了该方法的有效性,并在仔细考虑统计方法的情况下,将APFDc和NAPFD评价指标与定期重训练的模型进行比较。结果:我们对基于Hellinger距离的方法的实验评估证明了其在检测重训练点和降低相关成本方面的有效性与高效性。然而,该方法的性能可能因数据集而异。结论:我们的发现表明,数据漂移检测方法可协助识别CI环境中ML模型的重训练点,同时显著减少所需的重训练时间。这些方法对缺乏软件项目专业知识的从业者有帮助,使其能维持ML模型精度。
引用
@article{arxiv.2305.12736,
title = {Mitigating ML Model Decay in Continuous Integration with Data Drift Detection: An Empirical Study},
author = {Ali Kazemi Arani and Triet Huynh Minh Le and Mansooreh Zahedi and Muhammad Ali Babar},
journal= {arXiv preprint arXiv:2305.12736},
year = {2023}
}
备注
This paper got a rejection and we need to address the comments and upload the new version with new results