中文

何时重新训练?机器学习系统中的概念漂移检测

机器学习 2025-08-05 v2

摘要

随着机器学习 (ML) 技术的蓬勃发展,软件实践者构建 ML 系统以处理大量流式数据,用于各种软件工程任务,例如 AIOps 中的故障预测。使用历史数据训练的此类 ML 模型会因概念漂移(即训练期间与生产环境之间的数据及其关系(概念)变化)而出现性能下降。因此,使用概念漂移检测来监控部署的 ML 模型并在需要时重新训练 ML 模型至关重要。本文探索了在工业环境中应用于合成数据和真实世界数据集上的最新 (SOTA) 概念漂移检测技术。此类工业环境要求对标签工作量最小化,并在 ML 模型架构上实现最大通用性。我们发现当前的 SOTA 半监督方法不仅需要显著的标签工作量,而且仅适用于特定类型的 ML 模型。为克服这些限制,我们提出了一种新型模型无关的技术 (CDSeer) 用于检测概念漂移。我们的评估表明,CDSeer 在精度和召回率方面优于最新方法,同时需要的手动标签显著减少。我们通过在来自不同领域和用例的八个数据集上评估 CDSeer,在工业专有数据集上的内部部署结果表明,CDSeer 在精度上比 SOTA 概念漂移检测方法提高了 57.1%,而标签使用量减少了 99%。其性能也与需要 100% 数据标签的监督概念漂移检测方法相当。CDSeer 性能的提升以及易于采用的特性,使 ML 系统更加可靠。

关键词

引用

@article{arxiv.2410.09190,
  title  = {Time to Retrain? Detecting Concept Drifts in Machine Learning Systems},
  author = {Tri Minh Triet Pham and Karthikeyan Premkumar and Mohamed Naili and Jinqiu Yang},
  journal= {arXiv preprint arXiv:2410.09190},
  year   = {2025}
}

备注

12 pages, accepted by ICSE 2025