LLM 服务事件的自动收集与分析框架
性能
2025-03-18 v1 分布式、并行与集群计算
摘要
大型语言模型(LLM)服务如 ChatGPT、DALLE 和 Cursor 已迅速成为社会、企业和个人不可或缺的工具,使其能够实现聊天机器人、图像生成和代码辅助等应用。LLM 系统的复杂性使其容易出现故障,影响其可靠性和可用性,但其故障模式尚不完全了解,成为一个新兴问题。然而,目前领域内有限的数据集和研究,尤其缺乏基于事件报告的 LLM 服务故障分析工具。针对上述问题,本文提出了 FAILS,即首个开源的框架,用于收集和分析不同 LLM 服务和提供商的事件报告。FAILS 提供了全面的数据收集、分析和可视化功能,包括:(1)它可以通过其数据抓取和处理组件自动收集、清洗和更新事件数据;(2)它提供 17 种类型的故障分析,允许用户探索事件的时间趋势,分析服务可靠性指标,如平均恢复时间(MTTR)和平均故障间时间(MTBF);(3)它利用先进的 LLM 工具辅助数据分析和解释,使用户能够高效获取观察和见解。所有功能集成在后端,允许用户通过基于网页的前端界面轻松访问。FAILS 支持研究人员、工程师和普通用户理解 LLM 服务的故障模式,并进一步减轻操作性事件和中断。该框架已公开于 https://github.com/atlarge-research/FAILS。
引用
@article{arxiv.2503.12185,
title = {FAILS: A Framework for Automated Collection and Analysis of LLM Service Incidents},
author = {Sándor Battaglini-Fischer and Nishanthi Srinivasan and Bálint László Szarvas and Xiaoyu Chu and Alexandru Iosup},
journal= {arXiv preprint arXiv:2503.12185},
year = {2025}
}