为已部署机器学习算法设计监控策略:通过因果视角应对执行性效应
机器学习
2024-02-27 v2 机器学习
摘要
在基于机器学习(ML)的系统部署后,监控其性能对于确保算法随时间的有效性与安全性至关重要。当ML算法与其环境交互时,算法可能影响数据生成机制,并在评估其独立性能时成为偏差的主要来源,这一问题被称为执行性效应(performativity)。尽管已有研究展示了如何利用因果推断技术在存在执行性效应的情况下验证模型,但关于如何在执行性效应存在时监控模型的研究甚少。与模型验证场景不同,对于应监控哪些性能指标缺乏共识。不同的监控准则会影响所得检验统计量的可解释性、可识别性所需的假设以及检测速度。当这一选择进一步与使用观测数据还是干预数据的决策相结合时,ML部署团队面临众多监控选项。本工作的目的是凸显设计监控策略这一相对被低估的复杂性,以及因果推理如何为在这些选项间进行选择提供系统性框架。作为一个 motivating example,我们考虑一个用于预测非计划再入院的基于ML的风险预测算法。结合因果推断与统计过程控制工具,我们考虑了六种监控流程(三种候选监控准则与两种数据源),并在模拟研究中考察其运行特性。该案例研究的结果强调了看似简单(且显而易见)的事实:并非所有监控系统生来等同,这对ML监控系统的设计与文档化具有现实影响。
引用
@article{arxiv.2311.11463,
title = {Designing monitoring strategies for deployed machine learning algorithms: navigating performativity through a causal lens},
author = {Jean Feng and Adarsh Subbaswamy and Alexej Gossmann and Harvineet Singh and Berkman Sahiner and Mi-Ok Kim and Gene Pennello and Nicholas Petrick and Romain Pirracchio and Fan Xia},
journal= {arXiv preprint arXiv:2311.11463},
year = {2024}
}