中文

RT-LM:面向语言模型实时推理的不确定性感知资源管理

机器学习 2023-09-14 v1 计算与语言 系统与控制 系统与控制

摘要

近年来,语言模型(LMs)因其生成类人回复的能力而受到广泛关注。尽管这些 LMs 在对话 AI 等多种应用中展现出光明前景,但由于其极高的计算成本和不可预测的推理延迟,它们在各类设备上的部署面临挑战。这种多变的推理延迟被认定为语言内在不确定性所导致的结果,会造成计算效率低下并降低 LMs 的整体性能,尤其是在高流量工作负载下。遗憾的是,这些不确定性来源的带宽极广,使得延迟预测及此类不确定性所引发影响的预测变得复杂。为理解并缓解不确定性对实时响应需求系统的影响,我们迈出了第一步,去理解、量化并优化 LMs 中这些由不确定性引发的延迟性能变化。具体而言,我们提出 RT-LM,一个面向 LMs 实时推理的不确定性感知资源管理生态系统。RT-LM 创新性地量化了特定输入不确定性如何对延迟产生不利影响,常导致输出长度增加。利用这些洞察,我们设计了一种轻量且有效的方法,在运行时将输入文本不确定性与输出长度动态关联。将该量化作为延迟启发式,我们将不确定性信息集成到一个系统级调度器中,该调度器探索了若干由不确定性引发的优化机会,包括不确定性感知优先级排序、动态整合与战略性 CPU 卸载。在两种硬件平台上对五个最先进 LMs 的定量实验表明,RT-LM 能显著减少平均响应时间并提升吞吐量,同时仅产生极小的运行时开销。

关键词

引用

@article{arxiv.2309.06619,
  title  = {RT-LM: Uncertainty-Aware Resource Management for Real-Time Inference of Language Models},
  author = {Yufei Li and Zexin Li and Wei Yang and Cong Liu},
  journal= {arXiv preprint arXiv:2309.06619},
  year   = {2023}
}

备注

Accepted by RTSS 2023