中文

服务程序,而非提示

计算与语言 2025-10-30 v1

摘要

当前大语言模型(LLM)serving 系统主要为文本补全设计,因其僵化的架构而难以高效且灵活地适应日益复杂的 LLM 应用。我们提出一种新的 LLM serving 系统架构,通过服务程序而非提示来解决此问题。这些程序称为 LLM Inference Programs(LIPs),允许用户在运行时自定义 token 预测和 KV 缓存管理,并可将应用程序逻辑(如工具执行)的部分工作卸载至服务器。我们通过名为 Symphony 的系统示例说明了此架构,后者作为 LIPs 的操作系统。Symphony 通过系统调用暴露 LLM 模型计算,并通过专用文件系统虚拟化 KV 缓存,同时通过两级进程调度方案确保 GPU 效率。Symphony 有望为 LLM 应用的更高效和可扩展生态系统开启门路。

关键词

引用

@article{arxiv.2510.25412,
  title  = {Serve Programs, Not Prompts},
  author = {In Gim and Lin Zhong},
  journal= {arXiv preprint arXiv:2510.25412},
  year   = {2025}
}

备注

HotOS 2025. Follow-up implementation work (SOSP 2025) is available at arXiv:2510.24051