中文

面向数据流自动模型监控

机器学习 2019-08-13 v1 机器学习

摘要

检测概念漂移是影响生产系统的众所周知的问题。然而,文献中经常未被解决的两个重要问题是:1) 在标签不能立即可用时检测漂移;以及 2) 自动生成解释以识别漂移的可能原因。例如,在线支付中的欺诈检测模型可能在标签可用之前,因热销商品(假阳性增加)或真正的欺诈攻击(假阴性增加)而表现出漂移。在本文中,我们提出 SAMM,一种面向数据流的自动模型监控系统。SAMM 使用一种时间和空间高效的的无监督流算法检测概念漂移,并生成带有事件摘要及用于解释的重要特征的告警报告。SAMM 在五个真实世界欺诈检测数据集上进行了评估,每个数据集跨度长达八个月,总计超过 2200 万笔在线交易。我们通过领域专家的人工反馈评估 SAMM,向他们发送了系统生成的 100 份报告。我们的结果表明,SAMM 能够检测模型生命周期中领域专家认为有用的异常事件。鉴于这些结果,SAMM 将被部署于 Feedzai 欺诈检测解决方案的下一版本中。

关键词

引用

@article{arxiv.1908.04240,
  title  = {Automatic Model Monitoring for Data Streams},
  author = {Fábio Pinto and Marco O. P. Sampaio and Pedro Bizarro},
  journal= {arXiv preprint arXiv:1908.04240},
  year   = {2019}
}

备注

9 pages, 9 figures, 2 tables