从茶叶到系统图:面向上下文感知的机器学习监控综述与框架
软件工程
2025-08-26 v3
摘要
生产中的机器学习(ML)模型会因其更广泛的系统——从数据管道到部署环境——偏离训练假设而失败,这不仅仅是由于输入数据中的统计异常。尽管已有大量关于数据漂移、数据验证和异常分布检测的工作,但 ML 监控研究仍主要以模型为中心,忽略了上下文信息:关于模型周围系统的辅助信号(外部因素、数据管道、下游应用)。将这些上下文纳入不仅将统计异常转化为可操作的警报,还能实现结构化的根因分析。基于对 94 项初步研究的系统性综述,我们识别出 ML 监控的三个维度:关注的系统元素(自然环境或技术基础设施)、该元素的方面(运行状态、结构关系、规定属性)以及所用的表示(形式构造或非正式格式)。这形成了 Contextual System-Aspect-Representation(C-SAR)框架,是一个描述性模型综合我们的发现。我们识别出 20 种重复出现的三元组,并将其映射到支持的监控活动。该研究提供了 ML 监控的整体视角:从解释"茶叶"(即孤立的数据和性能统计)到构建和管理"系统图"(即连接数据、模型与运行上下文的端到端视图)。
引用
@article{arxiv.2506.10770,
title = {From Tea Leaves to System Maps: A Survey and Framework on Context-aware Machine Learning Monitoring},
author = {Joran Leest and Claudia Raibulet and Patricia Lago and Ilias Gerostathopoulos},
journal= {arXiv preprint arXiv:2506.10770},
year = {2025}
}