DiSCo:基于大语言模型的设备-服务器协作文本流式服务
机器学习
2025-05-27 v2 分布式、并行与集群计算
摘要
大语言模型(LLM)在文本流式服务中的快速崛起引入了显著的成本和用户体验(QoE)挑战,尤其是在满足每日数百万请求的同时,需要满足实时交互的 TTFT(首次标记延迟)和 TBT(标记间隔延迟)要求。我们的实际测量显示,服务器端和本地部署都难以满足多样化的 QoE 需求:服务器部署面临高成本和后跳问题(如互联网延迟和动态变化),而本地 LLM 推理受限于资源。我们引入 DiSCo,一种面向优化用户 QoE 的设备-服务器协作调度器,通过自适应路由请求并在端点之间迁移响应生成来实现最优,同时保持成本约束。DiSCo 采用成本感知调度,利用本地 LLM 推理可预测的速度和服务器推理的弹性容量,动态调度请求;同时引入基于标记的迁移机制,确保迁移期间的一致性标记交付。针对实际工作负载——包括 OpenAI GPT、DeepSeek 等商业服务,以及 LLaMA3 等开源部署——的评估显示,DiSCo 可通过降低尾部 TTFT(11-52%)和平均 TTFT(6-78%),在不同模型-设备配置下提升用户 QoE,同时通过迁移机制将服务成本降低最高可达 84%,而保持相当的 QoE 水平。
引用
@article{arxiv.2502.11417,
title = {DiSCo: Device-Server Collaborative LLM-Based Text Streaming Services},
author = {Ting Sun and Penghan Wang and Fan Lai},
journal= {arXiv preprint arXiv:2502.11417},
year = {2025}
}
备注
ACL 2025