服务程序,而非提示
计算与语言
2025-10-30 v1
摘要
当前大语言模型(LLM)serving 系统主要为文本补全设计,因其僵化的架构而难以高效且灵活地适应日益复杂的 LLM 应用。我们提出一种新的 LLM serving 系统架构,通过服务程序而非提示来解决此问题。这些程序称为 LLM Inference Programs(LIPs),允许用户在运行时自定义 token 预测和 KV 缓存管理,并可将应用程序逻辑(如工具执行)的部分工作卸载至服务器。我们通过名为 Symphony 的系统示例说明了此架构,后者作为 LIPs 的操作系统。Symphony 通过系统调用暴露 LLM 模型计算,并通过专用文件系统虚拟化 KV 缓存,同时通过两级进程调度方案确保 GPU 效率。Symphony 有望为 LLM 应用的更高效和可扩展生态系统开启门路。
引用
@article{arxiv.2510.25412,
title = {Serve Programs, Not Prompts},
author = {In Gim and Lin Zhong},
journal= {arXiv preprint arXiv:2510.25412},
year = {2025}
}
备注
HotOS 2025. Follow-up implementation work (SOSP 2025) is available at arXiv:2510.24051