AlerTiger:LinkedIn 用于 AI 模型健康监控的深度学习系统
机器学习
2023-06-06 v1
摘要
数据驱动型公司广泛使用 AI 模型开发产品和智能业务解决方案,使得这些模型的健康状况对业务成功至关重要。工业界的模型监控与告警面临独特挑战,包括缺乏清晰的模型健康指标定义、标签稀疏,以及快速的模型迭代导致模型和特征生命周期短。作为产品,还需满足可扩展性、泛化性和可解释性要求。为应对这些挑战,我们提出 AlerTiger,一种基于深度学习的 MLOps 模型监控系统,通过随时间检测模型输入特征与输出分数的异常,帮助公司各 AI 团队监控其 AI 模型健康。该系统包含四个主要步骤:模型统计生成、基于深度学习的异常检测、异常后处理以及用户告警。我们的方案生成三类指示 AI 模型健康的统计信息,提供两阶段深度异常检测方案以解决标签稀疏并实现监控新模型的泛化性,并为可操作告警提供整体报告。该方法已部署至 LinkedIn 绝大多数生产 AI 模型超过一年,并识别出若干模型问题,修复后带来了显著的业务指标提升。
引用
@article{arxiv.2306.01977,
title = {AlerTiger: Deep Learning for AI Model Health Monitoring at LinkedIn},
author = {Zhentao Xu and Ruoying Wang and Girish Balaji and Manas Bundele and Xiaofei Liu and Leo Liu and Tie Wang},
journal= {arXiv preprint arXiv:2306.01977},
year = {2023}
}