GhostServe:基于幽灵存活技术的轻量级 LLM 服务无故障检查点系统
分布式、并行与集群计算
2026-05-05 v1 人工智能
性能
摘要
百万级 token 级别的基于代理的应用的兴起,对大型语言模型(LLM)推理服务提出了前所未有的挑战。这种长时间运行的任务会增加其对硬件和软件故障的敏感性,导致昂贵的作业失败、资源浪费以及用户体验下降。随着序列长度增长,带状态的键值(KV)缓存成为分布式服务系统中的关键且脆弱组件。本文提出了 GhostServe,这是一个新的检查点解决方案,用于实现容错 LLM 服务。具体而言,GhostServe 通过对 KV 缓存进行 erasure coding 生成并存储 parity 分片于主机内存中。发生设备故障时,GhostServe 允许快速重建丢失的 KV 缓存,使推理过程能够无缝恢复,无需进行昂贵的完整重新计算或状态复制。评估显示,在系统故障存在的情况下,GhostServe 将单次批处理的检查点延迟降低最高达 2.7 倍,恢复延迟降低 2.1 倍,平均响应延迟降低 1.2 倍,为大规模高可用、成本效益高的 LLM 服务提供了可能。
关键词
引用
@article{arxiv.2605.00831,
title = {GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving},
author = {Shakya Jayakody and Youpeng Zhao and Chinmay Dhanraj Nehate and Jun Wang},
journal= {arXiv preprint arXiv:2605.00831},
year = {2026}
}
备注
MLSys 2026