Echo:面向大语言模型服务的混合在线-离线任务高效协同调度
分布式、并行与集群计算
2025-04-08 v1 人工智能
机器学习
摘要
大语言模型已广泛应用于各种应用中,涵盖交互式在线任务和批量离线任务。鉴于在线任务的突发性和延迟敏感性,资源过度配置是常见做法。这使得在在线负载较低期间能够整合对延迟不敏感的离线任务,从而提高资源利用率。然而,通过抢占机制策略性地服务在线和离线任务未能充分利用离线任务的灵活性,并且存在 KV cache 重计算和工作负载不规则的问题。在本文中,我们介绍了 Echo,一个在线-离线任务协同服务系统,包括调度器、KV cache 管理器和估计工具包。调度器和 KV cache 管理器紧密协作以最大化离线任务的吞吐量,同时估计器进一步预测执行时间以确保在线任务的 SLO。调度器利用上一迭代的批次信息来缩小寻找最优调度的搜索空间。KV cache 管理器根据任务类型和前缀共享机会设置 KV cache 的优先级,以减少重计算。最后,估计工具包预测执行时间、未来内存消耗和离线任务吞吐量,以指导调度器、KV cache 管理器和系统部署者。基于真实世界工作负载的评估表明,Echo 可以将离线任务吞吐量提高高达 ,同时满足在线任务的 SLO。
引用
@article{arxiv.2504.03651,
title = {Echo: Efficient Co-Scheduling of Hybrid Online-Offline Tasks for Large Language Model Serving},
author = {Zhibin Wang and Shipeng Li and Xue Li and Yuhang Zhou and Zhonghui Zhang and Zibo Wang and Rong Gu and Chen Tian and Kun Yang and Sheng Zhong},
journal= {arXiv preprint arXiv:2504.03651},
year = {2025}
}