中文

GhostServe:基于幽灵存活技术的轻量级 LLM 服务无故障检查点系统

分布式、并行与集群计算 2026-05-05 v1 人工智能 性能

摘要

百万级 token 级别的基于代理的应用的兴起,对大型语言模型(LLM)推理服务提出了前所未有的挑战。这种长时间运行的任务会增加其对硬件和软件故障的敏感性,导致昂贵的作业失败、资源浪费以及用户体验下降。随着序列长度增长,带状态的键值(KV)缓存成为分布式服务系统中的关键且脆弱组件。本文提出了 GhostServe,这是一个新的检查点解决方案,用于实现容错 LLM 服务。具体而言,GhostServe 通过对 KV 缓存进行 erasure coding 生成并存储 parity 分片于主机内存中。发生设备故障时,GhostServe 允许快速重建丢失的 KV 缓存,使推理过程能够无缝恢复,无需进行昂贵的完整重新计算或状态复制。评估显示,在系统故障存在的情况下,GhostServe 将单次批处理的检查点延迟降低最高达 2.7 倍,恢复延迟降低 2.1 倍,平均响应延迟降低 1.2 倍,为大规模高可用、成本效益高的 LLM 服务提供了可能。

关键词

引用

@article{arxiv.2605.00831,
  title  = {GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving},
  author = {Shakya Jayakody and Youpeng Zhao and Chinmay Dhanraj Nehate and Jun Wang},
  journal= {arXiv preprint arXiv:2605.00831},
  year   = {2026}
}

备注

MLSys 2026