中文

面向数字平台的大规模 MLOps 监控

计量经济学 2025-04-24 v1 应用统计

摘要

机器学习模型因其在预测任务中的卓越性能而广受认可。为维持其在流式数据场景下的性能,这些模型必须进行监控并频繁重新训练。这可以通过 MLOps 技术实现,由 MLOps 工程师负责监督。然而,在数据流数量大且不稳定的数字平台场景中,标准监控要么效果不佳,要么对 MLOps 工程师的劳动负担过大。因此,企业往往退回到一些性能较差但简单易行的 ML 模型上,而不进行监控。我们采用设计科学方法,提出一种新的监控框架——机器学习监控代理 (Machine Learning Monitoring Agent, MLMA),其设计旨在以合理的劳动力成本在大规模环境下适用于任何 ML 模型。该框架的关键特性是基于数据自适应参考损失批次的测试驱动自动重训练机制。MLOps 工程师通过关键指标保持关注,并可主动或事后地维持生产环境中 ML 模型的性能。我们将在一个最后一公里配送平台上进行大规模测试,以实证验证我们的监控框架。

关键词

引用

@article{arxiv.2504.16789,
  title  = {MLOps Monitoring at Scale for Digital Platforms},
  author = {Yu Jeffrey Hu and Jeroen Rombouts and Ines Wilms},
  journal= {arXiv preprint arXiv:2504.16789},
  year   = {2025}
}