InferCept:面向增强大型语言模型推理的高效拦截支持
机器学习
2024-05-31 v2 计算与语言
分布式、并行与集群计算
摘要
大型语言模型正越来越多地与外部环境、工具和代理(如 ChatGPT 插件)集成,以将其能力扩展到以语言为中心的任务之外。然而,当今的 LLM 推理系统是为独立 LLM 设计的。它们将每次外部交互视为 LLM 生成的结束,并在交互完成时形成新的请求,导致对已计算上下文的不必要重新计算,这占用了总模型转发时间的 37-40%。本文提出了 InferCept,这是第一个针对增强 LLM 并支持高效拦截 LLM 生成的 LLM 推理框架。InferCept 最小化了 LLM 拦截造成的 GPU 资源浪费,并将节省下来的内存专用于服务更多请求。与最先进的 LLM 推理系统相比,InferCept 将整体服务吞吐量提高了 1.6 倍至 2 倍,并且每秒完成的请求数增加了 2 倍。
引用
@article{arxiv.2402.01869,
title = {InferCept: Efficient Intercept Support for Augmented Large Language Model Inference},
author = {Reyna Abhyankar and Zijian He and Vikranth Srivatsa and Hao Zhang and Yiying Zhang},
journal= {arXiv preprint arXiv:2402.01869},
year = {2024}
}