面向站点可靠性工程师的 LLM 辅助异常检测服务:增强云基础设施韧性
机器人学
2025-01-29 v1
摘要
本文介绍了一个面向工业时序数据、具有可通用 API 的可扩展异常检测服务,旨在帮助站点可靠性工程师 (SRE) 管理云基础设施。该服务高效地支持复杂数据流中的异常检测,使能够主动识别和解决问题。此外,它提出了一种创新的云基础设施异常建模方法,利用大型语言模型 (LLM) 理解关键组件、其故障模式和行为。提供了一套针对单变量和多变量时序数据的异常检测算法,包括基于回归的、基于混合模型的和半监督方法。我们提供了服务使用模式的见解,全年超过 500 位用户和 20 万次 API 调用。该服务已成功应用于各种工业场景,包括面向 AI 应用的物联网系统。我们还在公共异常基准测试上对系统进行了评估,以显示其有效性。通过利用该服务,SRE 可以在问题升级之前主动识别潜在问题,从而减少停机时间并提高事件响应速度,从而最终提升客户体验。我们计划将系统扩展以包括时序基础模型,实现零样本异常检测能力。
引用
@article{arxiv.2501.16743,
title = {Hierarchical Trajectory (Re)Planning for a Large Scale Swarm},
author = {Lishuo Pan and Yutong Wang and Nora Ayanian},
journal= {arXiv preprint arXiv:2501.16743},
year = {2025}
}
备注
13 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2407.02777