面向数据分布漂移的基于云分类器重训练的多准则自动化 MLOps 流水线
机器学习
2025-12-15 v1
摘要
当底层数据分布随时间变化时,机器学习(ML)模型的性能通常会下降,这种现象被称为数据分布漂移。发生这种情况时,ML 模型需要被重新训练并重新部署。ML Operations (MLOps) 通常是手动的,即由人工触发模型重训练和重新部署的过程。在这项工作中,我们提出了一种自动化 MLOps 流水线,旨在应对由显著数据分布变化引发的神经网络分类器重训练。我们的 MLOps 流水线采用多准则统计技术来检测分布漂移,并仅在必要时触发模型更新,从而确保计算效率和资源优化。我们通过在多个基准异常检测数据集上的实验展示了该框架的有效性,表明与传统重训练策略相比,模型准确性和鲁棒性均有显著提升。我们的工作为在数据分布变化常见的动态真实世界场景中部署更可靠、更具适应性的 ML 系统奠定了基础。
引用
@article{arxiv.2512.11541,
title = {A Multi-Criteria Automated MLOps Pipeline for Cost-Effective Cloud-Based Classifier Retraining in Response to Data Distribution Shifts},
author = {Emmanuel K. Katalay and David O. Dimandja and Jordan F. Masakuna},
journal= {arXiv preprint arXiv:2512.11541},
year = {2025}
}
备注
11 pages, 3 figures and 2 tables. Preliminary results on an automated MLOps pipeline