Andes:定义和增强基于LLM的文本流服务中的体验质量
分布式、并行与集群计算
2024-12-16 v2 机器学习
摘要
大型语言模型(LLM)如今是实时翻译和聊天机器人等对话式AI服务的核心,这些服务通过逐步向用户流式传输文本来提供实时交互。然而,现有的LLM服务系统未能提供良好的用户体验,因为它们的优化指标并不总是与用户体验一致。本文首先通过考虑每个用户的端到端交互时间线,引入并定义了文本流服务的体验质量(QoE)概念。基于此,我们提出了Andes,一个QoE感知的LLM服务系统,通过确保用户及时收到第一个令牌,并以平滑、可消化的速度接收后续令牌(即使在高峰时段)来增强用户体验。这得益于Andes的抢占式请求调度器,该调度器基于每个请求的预期QoE增益和GPU资源使用情况,在令牌粒度上动态优先处理请求。我们的评估表明,与最先进的LLM服务系统相比,在相同GPU资源下,Andes将平均QoE提升了高达,或者在保持相同高QoE的同时节省了高达61%的GPU资源。
引用
@article{arxiv.2404.16283,
title = {Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services},
author = {Jiachen Liu and Jae-Won Chung and Zhiyu Wu and Fan Lai and Myungjin Lee and Mosharaf Chowdhury},
journal= {arXiv preprint arXiv:2404.16283},
year = {2024}
}
备注
16 pages, 21 figures