中文

InferCept:面向增强大型语言模型推理的高效拦截支持

机器学习 2024-05-31 v2 计算与语言 分布式、并行与集群计算

摘要

大型语言模型正越来越多地与外部环境、工具和代理(如 ChatGPT 插件)集成,以将其能力扩展到以语言为中心的任务之外。然而,当今的 LLM 推理系统是为独立 LLM 设计的。它们将每次外部交互视为 LLM 生成的结束,并在交互完成时形成新的请求,导致对已计算上下文的不必要重新计算,这占用了总模型转发时间的 37-40%。本文提出了 InferCept,这是第一个针对增强 LLM 并支持高效拦截 LLM 生成的 LLM 推理框架。InferCept 最小化了 LLM 拦截造成的 GPU 资源浪费,并将节省下来的内存专用于服务更多请求。与最先进的 LLM 推理系统相比,InferCept 将整体服务吞吐量提高了 1.6 倍至 2 倍,并且每秒完成的请求数增加了 2 倍。

关键词

引用

@article{arxiv.2402.01869,
  title  = {InferCept: Efficient Intercept Support for Augmented Large Language Model Inference},
  author = {Reyna Abhyankar and Zijian He and Vikranth Srivatsa and Hao Zhang and Yiying Zhang},
  journal= {arXiv preprint arXiv:2402.01869},
  year   = {2024}
}