大语言模型服务中的公平性
人工智能
2024-06-06 v2 机器学习
性能
摘要
高需求的 LLM 推理服务(例如 ChatGPT 和 BARD)支持从简短聊天对话到长文档阅读的各种请求。为了确保公平处理所有客户端请求,大多数主要的 LLM 推理服务都实施了请求速率限制,以防止任何客户端独占请求队列。然而,这种初级的公平性概念也会导致在有空闲容量时资源利用率低下和客户端体验不佳。尽管关于公平调度的文献丰富,但由于 LLM 请求长度的不可预测性及其在并行加速器上独特的批处理特性,服务 LLM 带来了新的挑战。本文基于考虑输入和输出 token 数量的成本函数,引入了 LLM 服务公平性的定义。为了实现服务公平性,我们提出了一种新颖的调度算法——虚拟 Token 计数器(Virtual Token Counter, VTC),这是一种基于连续批处理机制的公平调度器。我们证明了在两个积压客户端之间的服务差异存在 2 倍的紧密上界,符合保工作(work-conserving)的要求。通过大量实验,我们展示了 VTC 在确保公平性方面的卓越性能,特别是在与其他基线方法对比时,后者在各种条件下表现出不足之处。可复现代码见 https://github.com/Ying1123/VTC-artifact
引用
@article{arxiv.2401.00588,
title = {Fairness in Serving Large Language Models},
author = {Ying Sheng and Shiyi Cao and Dacheng Li and Banghua Zhu and Zhuohan Li and Danyang Zhuo and Joseph E. Gonzalez and Ion Stoica},
journal= {arXiv preprint arXiv:2401.00588},
year = {2024}
}