中文

面向 AI 推理服务的可靠性提升:来自真实生产事故的实证研究

分布式、并行与集群计算 2025-11-12 v1 计算机与社会

摘要

超大规模大语言模型(LLM)推理对云端系统提出了巨大的需求,即使短暂的故障也可能导致显著的用户和业务影响。为更好地理解和缓解这些风险,我们呈现的是首批供应商内部、基于实践的 LLM 推理事故分析。我们制定了基于一年运营经验的分类法和方法论,并在 156 起高危事件上进行验证,随后针对 2025 年 4-6 月开展针对性定量研究,以确保时效性和相关性。我们的做法实现了高一致性标记(Cohen's K ~0.89),识别出主导性故障模式(本数据集中约 60% 为推理引擎故障,其中约 40% 为超时),并暴露出缓解手段(约 74% 自动检测;约 28% 需要热修复)。除了热修复之外,许多事故还通过流量路由、节点重新平衡或容量增加策略进行缓解,这表明还有进一步的自动化潜力。我们还展示了分类法如何指导特定策略的实施,如连接存活性、GPU 容量感知路由和端点隔离,从而减少事故影响并加快恢复速度。最后,我们贡献了一个面向实践者的采用清单,使他人能够在自身系统中复制我们的分类法、分析和自动化机会。该研究表明,系统化、基于实证的推理运营分析能够在规模化的 LLM 服务中实现更可靠、更具成本效益的推理。

关键词

引用

@article{arxiv.2511.07424,
  title  = {Enhancing reliability in AI inference services: An empirical study on real production incidents},
  author = {Bhala Ranganathan and Mickey Zhang and Kai Wu},
  journal= {arXiv preprint arXiv:2511.07424},
  year   = {2025}
}