Conveyor: 利用工具部分执行实现高效的工具感知LLM服务
计算与语言
2024-06-06 v2 分布式、并行与集群计算
机器学习
摘要
由于与外部工具调用(如ChatGPT插件)的集成,大语言模型(LLM)服务工作负载的复杂性已显著增加。在本文中,我们识别出一个新的机会,可以在触发工具的请求中实现高效的LLM服务:在LLM解码的同时进行工具部分执行。为此,我们设计了Conveyor,一个针对处理涉及外部工具的请求而优化的高效LLM服务系统。我们为工具开发者引入了一个新颖的接口,用于向LLM服务系统暴露部分执行机会,并引入了一个促进部分工具执行的请求调度器。我们的结果表明,工具部分执行可以将请求完成延迟最多提高38.8%。
引用
@article{arxiv.2406.00059,
title = {Conveyor: Efficient Tool-aware LLM Serving with Tool Partial Execution},
author = {Yechen Xu and Xinhao Kong and Tingjun Chen and Danyang Zhuo},
journal= {arXiv preprint arXiv:2406.00059},
year = {2024}
}
备注
11 pages, 8 figures